Claude API

Opus 5.5独立ベンチマーク第3波の総括 — Artificial Analysis Intelligence Index首位58・Terminal-Bench独立測定59.6%でAnthropic発表値66.4%との6.8pt乖離が定着、GPT-6 Astraとの差は独立測定で約1.7ptに縮小

元記事を読む(emergent.sh) ↗

Summary

9月22日リリースのOpus 5.5に対する独立ベンチマーク評価が第3波として安定化。Artificial Analysis Intelligence Index max effort 58で測定史上最高スコアを確認(HLE 61.4%・SciCode 66.9%で10評価中6項目リード)。一方Terminal-Bench 4.0では独立測定59.6%でAnthropic発表値66.4%との6.8pt乖離が第2波から継続して定着。GPT-6 Astraとの差は独立測定で59.6% vs 57.9%(約1.7pt)に縮小し、Anthropic発表値ベースの8.5pt差とは大きく異なる実態が判明。SonarSourceは27.5%少ないコード・40%少ないトークン消費を確認し実用性を裏付け。Gray Swanプロンプトインジェクション成功率がFable 5.1と同率最低を記録しセキュリティ面でもフロンティア級。effortダイヤル設定の違いがベンチマークスコアに大きく影響するため、独立検証と公式値の両方を参照したモデル選択判断が推奨。

Key Takeaways

  • ▸ Artificial Analysis Intelligence Index 58で測定史上最高 — max effort設定での総合首位を独立確認
  • ▸ Terminal-Bench独立測定59.6% vs Anthropic発表値66.4%で6.8pt乖離が定着 — effort設定差が主因の可能性
  • ▸ GPT-6 Astraとの差は独立測定で約1.7ptに縮小 — 公式8.5pt差とは異なる実態
  • ▸ SonarSource 27.5%コード削減・40%トークン削減 — 実用性能の高さは独立確認済み

Best Practice Updates

  • ✓ モデル選択判断にはAnthropic公式ベンチマークと独立ベンチマークの両方を参照 — effort設定差による乖離を認識した上で評価
  • ✓ Opus 5.5のeffortダイヤル最適化がコスト・性能トレードオフの最大レバー — medium effortで日常利用・max effortで高難度タスクの使い分けが推奨

Same Day Signals

すべて見る →

元記事の著作権は各著作者に帰属します。