Claude API
Artificial Analysis: Opus 5がIntelligence Index・Agentic Index共に#1を獲得 — 586モデル中首位、Fable 5を上回りCost per Taskで26%優位
元記事を読む(artificialanalysis.ai) ↗Summary
7月25日にArtificial AnalysisがOpus 5の独立評価結果を公開。Intelligence Index v4.1でスコア61を記録し、586モデル中#1を獲得。Fable 5(60)・GPT-5.6 Sol(59)・Kimi K3(57)を上回る。Agentic Indexでも55.3で首位(GPT-5.6 Sol: 54.0、Fable 5: 52.8)。独自ベンチマークAA-Briefcase(エージェンティック知識作業)ではElo 1720を記録し、Fable 5(1574)に146ポイント差。GDPval-AA v2とAA-Briefcaseの両方で過去最高スコアを記録。Cost per TaskではFable 5比26%低コストで同等以上の性能を実現。Artificial Analysisはリリース前にAnthropicと協力して評価を実施。「narrowly the most intelligent model」と評価し、Opus 5がフロンティアモデルの価格性能比を根本的に変えたと分析。
Key Takeaways
- ▸ Intelligence Index 61(#1)はFable 5との差がわずか1ポイントだが、$5/$25 vs $10/$50の価格差を考慮すると実質的な価格性能比の勝利
- ▸ AA-Briefcase Elo 1720のFable 5比+146ポイントはエージェンティック知識作業(リサーチ・分析・レポート作成)でOpus 5がFable 5を明確に上回ることを示す
- ▸ Agentic Index首位はAutomationBench・OSWorld等の実環境エージェントタスクでの総合優位を独立評価で確認
- ▸ 586モデル中#1は2026年7月時点での最高評価モデルとしてOpus 5を位置づけ — GPT-5.6 Sol・Kimi K3含む全競合モデルを上回る
Best Practice Updates
- ✓ エージェンティック知識作業(リサーチ・ブリーフィング・レポート作成)はFable 5からOpus 5への移行で26%コスト削減+品質向上が独立評価で実証
- ✓ Artificial Analysis Intelligence Index・Agentic Indexの定期モニタリングがモデル選択の客観的判断基準として確立
Same Day Signals
すべて見る →- Claude API Claude API新機能: Mid-conversation Tool Changes(ベータ)でエージェントのプログレッシブ・ディスクロージャーパターンが実現 — ツール追加・削除をプロンプトキャッシュ維持しつつ会話中に動的制御
- Claude API Claude API新機能: Default Fallbacksモード(ベータ)で安全性分類器によるrefusalの自動フォールバックルーティングが実現 — モデルリスト管理不要の「おまかせ」フォールバック
- MCP MCP 2026-07-28最終仕様公開まで残り2日 — 12ヶ月猶予期間付きdeprecationでsampling・roots・logging廃止、ステートレスコア+Extensions Framework正式化
- Claude API Opus 5 vs GPT-5.6 Sol詳細ベンチマーク比較 — SWE-bench Pro +14.6pt・ARC-AGI 3で3.9倍・12ベンチマーク中9勝でOpus 5が$5/$25の価格優位と共に総合リード
元記事の著作権は各著作者に帰属します。