Claude API

Anthropic「Project Swap」で201名参加の自律AIエージェント書籍取引市場を運営 — モデル能力がプロンプト設計より交渉成果に大きく影響

元記事を読む(anthropic.com) ↗

Summary

9月24日にAnthropic研究ブログで公開。6オフィスの201名社員が参加し各自のClaudeエージェントが分散型取引市場で自律交渉。5分間の嗜好会話で61%ペアワイズ一致(人気度ベース・協調フィルタリングを上回る精度)。モデルアーキテクチャ(能力)がプロンプト指示(prosocial/ruthless等)より交渉パフォーマンスに大きく影響し「モデル選択>プロンプト最適化」が定量実証された。参加者は7.2/10満足度で年間書籍予算30%をAI委任可能と回答。

Key Takeaways

  • ▸ 5分間の嗜好会話で61%ペアワイズ一致 — 人気度ベース・協調フィルタリングを上回るパーソナライズ精度
  • ▸ モデル能力がプロンプト指示より交渉パフォーマンスに大きく影響 — 「モデル選択>プロンプト最適化」が定量実証
  • ▸ Opus 0.88 vs Haiku 0.75の交渉成果差 — 高性能モデルの利用がエージェント品質に直結することが定量確認
  • ▸ 参加者は年間書籍予算30%をAI委任可能と回答 — 「知識豊富な友人」と同等信頼度
  • ▸ 300語vs150語の詳細入力で4ptのアライメント改善 — ユーザー入力の質がエージェント品質に直接影響

Best Practice Updates

  • ✓ エージェント設計では「プロンプト最適化」より「モデル選択」が成果に大きく影響 — 高性能モデル(Opus級)の利用がエージェント品質に直結
  • ✓ ユーザー嗜好の入力量と質がエージェント品質に比例 — エージェントプロンプト設計では充実したコンテキスト提供の仕組みを設計すべき

Same Day Signals

すべて見る →

元記事の著作権は各著作者に帰属します。