Claude API

Opus 5がArtificial Analysis 586モデル中Intelligence Index・Agentic Index共に#1 — AA-Briefcase Elo +146ptでFable 5を明確に上回りコスト26%低減

元記事を読む(artificialanalysis.ai)

Summary

Artificial Analysisの独立評価でOpus 5がIntelligence Index v4.1スコア61(586モデル中#1、Fable 5: 60、GPT-5.6 Sol: 59)、Agentic Index 55.3(#1、GPT-5.6 Sol: 54.0、Fable 5: 52.8)を記録。AA-Briefcase(エージェンティック知識作業ベンチマーク)でElo 1720(Fable 5: 1574、+146pt)。Cost per TaskがFable 5比26%低コスト。SWE-bench Pro 79.2% vs GPT-5.6 Sol 64.6%(+14.6pt)、ARC-AGI 3 30.2% vs 7.8%(3.9倍)、CursorBench 3.2でFable 5の0.5%差・コスト半額。12ベンチマーク中9勝でGPT-5.6 Solに対する定量的優位が確認。

Key Takeaways

  • 独立第三者評価でOpus 5が全AIモデル首位 — ベンダー発表ベンチマークではなく独立機関の評価として信頼性が高い
  • AA-Briefcase +146ptはリサーチ・分析・レポート作成でFable 5より明確に優位 — 知識作業タスクでのFable 5利用はコスト効率で正当化困難
  • $5/$25でFable 5($10/$50)比26%低コスト — エージェントワークフローのデフォルトモデルをOpus 5に設定することが合理的

Best Practice Updates

  • エージェントワークフローのデフォルトモデルをOpus 5に設定しFable 5はIntelligence Index差1ptを正当化できるタスクのみに限定
  • Artificial Analysis Intelligence Index・Agentic Indexの定期モニタリングをモデル選択の客観的基準として組み込み

Same Day Signals

すべて見る →

元記事の著作権は各著作者に帰属します。