Claude API

Anthropic「Project Swap」で自律AIエージェントが書籍取引市場を運営 — 201名参加・5分会話で嗜好61%一致、モデル能力がプロンプト設計より交渉成果に大きく影響

元記事を読む(anthropic.com) ↗

Summary

9月24日にAnthropicが「Project Swap」研究を公開。201名の社員が参加し、各自のClaudeエージェントが書籍取引市場で自律的に交渉。5分間の会話で嗜好の61%ペアワイズ一致を達成し、モデルアーキテクチャ(能力)がプロンプト指示よりも交渉パフォーマンスに大きく影響することが実証された。Opusが効率0.88、Haikuが0.75と、モデル能力と市場効率が強く相関。

Key Takeaways

  • ▸ 5分間の会話で嗜好の61%ペアワイズ一致 — 人気度ベース・協調フィルタリングを上回る精度で短時間の嗜好抽出能力を実証
  • ▸ モデルアーキテクチャがプロンプト指示より交渉成果に大きく影響 — Opus効率0.88 vs Haiku 0.75で強モデルが弱モデルを一貫して上回る
  • ▸ 「prosocial」エージェントは他者への配慮で若干成績低下・「ruthless」エージェントは+0.02スコア向上 — エージェント行動指針の倫理的設計にデータドリブンな根拠を提供
  • ▸ 参加者は7.2/10の満足度・年間書籍予算の30%をAIエージェントに委任可能と回答 — 信頼度は「知識豊富な友人に委任」と同等水準
  • ▸ 4月のProject Deal(契約交渉実験)の後続としてエージェント経済の実証研究が継続 — 自動化調達・パーソナライズドコマースへの応用基盤を構築

Best Practice Updates

  • ✓ エージェントプロンプト設計では「指示の最適化」より「モデル選択」がパフォーマンスに大きく影響することがAnthropic自身の実験で定量実証
  • ✓ エージェント間交渉タスクではOpus級モデルの使用が市場効率を最大化 — コスト最適化のためのモデルダウングレードは交渉品質に直接影響

Same Day Signals

すべて見る →

元記事の著作権は各著作者に帰属します。