Claude API

Fable 5.1独立ベンチマーク分析が拡大 — Terminal-Bench 4.0で55.8%・GDPval-AA v2で1,853とOpus 5超え、effort別コスト最適化パターンが確立

元記事を読む(vellum.ai)

Summary

9月1日リリースのFable 5.1について複数の独立ベンチマーク分析が公開。Terminal-Bench 4.0で55.8%(Fable 5: 42.0%、Opus 5: 52.3%)、Terminal-Bench-Science 0.1で52.6%(Fable 5: 24.7%で2倍超、GPT-5.6 Sol: 22.4%)、GDPval-AA v2知識作業Eloで1,853(Opus 5: 1,824、Fable 5: 1,723)とフロンティアモデル全指標で首位。Data Science Dojoは「low effortがFable 5のmax effortを科学ベンチマークで上回り4分の1のコスト」、CruxDigitsは「CursorBench 3.2.0でlow effortがFable 5 high effortの3分の1コストで同等」と分析。Vellum・MarkTechPost・Coursiv・KIE AI・explainx.ai等が詳細ベンチマーク解説を公開。

Key Takeaways

  • Terminal-Bench 4.0: 55.8%でOpus 5(52.3%)・Fable 5(42.0%)を上回りフロンティア首位
  • Terminal-Bench-Science 0.1: 52.6%でFable 5(24.7%)の2倍超・GPT-5.6 Sol(22.4%)を大幅リード
  • GDPval-AA v2: 1,853でOpus 5(1,824)超え — 知識作業でもフロンティア最高評価
  • AutomationBench: 31.4%でFable 5(17.1%)・Opus 5(26.9%)を上回る
  • low effortがFable 5 max effortを科学ベンチマークで上回り約4分の1のコスト — effort別コスト最適化が本格化
  • CursorBench 3.2.0でlow effortがFable 5 high effortの約3分の1コストで同等

Best Practice Updates

  • Fable 5.1のeffort別性能カーブが非線形 — 日常はlow/medium、高難度はmax effortの使い分けがコスト効率の鍵
  • low effort×キャッシュ読取75%値下げの組み合わせでFable 5比最大80%のコスト削減が理論的に可能

Same Day Signals

すべて見る →

元記事の著作権は各著作者に帰属します。