Claude API
Fable 5.1独立ベンチマーク分析が拡大 — Terminal-Bench 4.0で55.8%・GDPval-AA v2で1,853とOpus 5超え、effort別コスト最適化パターンが確立
元記事を読む(vellum.ai) ↗Summary
9月1日リリースのFable 5.1について複数の独立ベンチマーク分析が公開。Terminal-Bench 4.0で55.8%(Fable 5: 42.0%、Opus 5: 52.3%)、Terminal-Bench-Science 0.1で52.6%(Fable 5: 24.7%で2倍超、GPT-5.6 Sol: 22.4%)、GDPval-AA v2知識作業Eloで1,853(Opus 5: 1,824、Fable 5: 1,723)とフロンティアモデル全指標で首位。Data Science Dojoは「low effortがFable 5のmax effortを科学ベンチマークで上回り4分の1のコスト」、CruxDigitsは「CursorBench 3.2.0でlow effortがFable 5 high effortの3分の1コストで同等」と分析。Vellum・MarkTechPost・Coursiv・KIE AI・explainx.ai等が詳細ベンチマーク解説を公開。
Key Takeaways
- ▸ Terminal-Bench 4.0: 55.8%でOpus 5(52.3%)・Fable 5(42.0%)を上回りフロンティア首位
- ▸ Terminal-Bench-Science 0.1: 52.6%でFable 5(24.7%)の2倍超・GPT-5.6 Sol(22.4%)を大幅リード
- ▸ GDPval-AA v2: 1,853でOpus 5(1,824)超え — 知識作業でもフロンティア最高評価
- ▸ AutomationBench: 31.4%でFable 5(17.1%)・Opus 5(26.9%)を上回る
- ▸ low effortがFable 5 max effortを科学ベンチマークで上回り約4分の1のコスト — effort別コスト最適化が本格化
- ▸ CursorBench 3.2.0でlow effortがFable 5 high effortの約3分の1コストで同等
Best Practice Updates
- ✓ Fable 5.1のeffort別性能カーブが非線形 — 日常はlow/medium、高難度はmax effortの使い分けがコスト効率の鍵
- ✓ low effort×キャッシュ読取75%値下げの組み合わせでFable 5比最大80%のコスト削減が理論的に可能
Same Day Signals
すべて見る →- Claude API Enterprise Frontier Safeguards(EFS)発表 — 顧客管理クラウドでのゼロデータ保持+自動安全監視でFable 5/5.1のエンタープライズ導入障壁が解消
- Anthropic Anthropic IPOロードショーが9月に本格化 — Goldman Sachs・JPMorgan・Morgan Stanley・Citigroup 4行引受体制で10月上場を目指す
- Anthropic Claude Cowork Built-in Browser(デスクトップ内蔵ブラウザ)が順次展開中 — Chromium搭載でWebタスクのエージェント実行がシームレスに
- Claude Code Claude Code週間使用量25%恒久化まで残り11日(9月14日)— 複数メディアが「実質17%カット」分析を展開、Anthropicが効率化施策を予告
元記事の著作権は各著作者に帰属します。