Claude API
Opus 5.5独立ベンチマーク第3波の総括 — Artificial Analysis Intelligence Index首位58・Terminal-Bench独立測定59.6%でAnthropic発表値66.4%との6.8pt乖離が定着、GPT-6 Astraとの差は独立測定で約1.7ptに縮小
元記事を読む(emergent.sh) ↗Summary
9月22日リリースのOpus 5.5に対する独立ベンチマーク評価が第3波として安定化。Artificial Analysis Intelligence Index max effort 58で測定史上最高スコアを確認(HLE 61.4%・SciCode 66.9%で10評価中6項目リード)。一方Terminal-Bench 4.0では独立測定59.6%でAnthropic発表値66.4%との6.8pt乖離が第2波から継続して定着。GPT-6 Astraとの差は独立測定で59.6% vs 57.9%(約1.7pt)に縮小し、Anthropic発表値ベースの8.5pt差とは大きく異なる実態が判明。SonarSourceは27.5%少ないコード・40%少ないトークン消費を確認し実用性を裏付け。Gray Swanプロンプトインジェクション成功率がFable 5.1と同率最低を記録しセキュリティ面でもフロンティア級。effortダイヤル設定の違いがベンチマークスコアに大きく影響するため、独立検証と公式値の両方を参照したモデル選択判断が推奨。
Key Takeaways
- ▸ Artificial Analysis Intelligence Index 58で測定史上最高 — max effort設定での総合首位を独立確認
- ▸ Terminal-Bench独立測定59.6% vs Anthropic発表値66.4%で6.8pt乖離が定着 — effort設定差が主因の可能性
- ▸ GPT-6 Astraとの差は独立測定で約1.7ptに縮小 — 公式8.5pt差とは異なる実態
- ▸ SonarSource 27.5%コード削減・40%トークン削減 — 実用性能の高さは独立確認済み
Best Practice Updates
- ✓ モデル選択判断にはAnthropic公式ベンチマークと独立ベンチマークの両方を参照 — effort設定差による乖離を認識した上で評価
- ✓ Opus 5.5のeffortダイヤル最適化がコスト・性能トレードオフの最大レバー — medium effortで日常利用・max effortで高難度タスクの使い分けが推奨
Same Day Signals
すべて見る →- Claude Code Claude for Government Desktop GA移行が10月4日に迫る — FedRAMP High認定環境でClaude Code+Coworkが全政府組織に本番提供、未移行組織は自動移行
- Anthropic Anthropic IPO公開S-1 EDGAR提出が10月2日時点でも未確認 — ロードショー10月中旬開始がさらに圧迫、Reutersリーク後の正式提出に注目集中
- Claude Code Anthropic claude.devデベロッパーハブが9月30日にローンチ — エンジニアリングブログ・Claude Code/APIガイド・動画を一元集約した公式開発者ポータル
元記事の著作権は各著作者に帰属します。