Claude API

Opus 5.5独立ベンチマーク評価の第2波 — Artificial AnalysisがIntelligence Index 58でmax effort首位を確認もTerminal-Bench 59.6%でAnthropic発表値66.4%との乖離を指摘、独立検証の重要性が再確認

元記事を読む(vellum.ai) ↗

Summary

9月24-25日にVellum・OfficeChai・Orcarouter・Technology Org・Trendingtopics.eu等がOpus 5.5の独立ベンチマーク詳細分析を公開。Artificial AnalysisはIntelligence Index max effortで58の測定史上最高スコアを確認しHumanity's Last Exam 61.4%・SciCode 66.9%等10評価中6でリード。一方Terminal-Bench 4.0では59.6%と測定しAnthropic発表値66.4%との間に6.8pt乖離が存在 — テスト条件(effort設定・セットアップ)の違いが原因の可能性。Vellumは「独立測定値がAnthropic発表値より控えめ」と明示的に指摘しベンチマーク評価には独立第三者検証が重要と強調。OfficeChai・Orcarouterも各ベンチマークスコアのソースを網羅的に整理。

Key Takeaways

  • ▸ Artificial Analysis Intelligence Index max effort 58で測定史上最高 — 独立第三者機関によるトップスコア確認
  • ▸ Terminal-Bench 59.6% vs Anthropic発表値66.4%で6.8pt乖離 — テスト条件の違いが原因の可能性だが独立検証の重要性を示唆
  • ▸ HLE 61.4%・SciCode 66.9%で10評価中6リード — 科学・推論タスクでの優位性は独立確認
  • ▸ Vellumが「独立値はAnthropic発表値より控えめ」と明示 — ベンチマーク評価には公式値と独立値の両方を参照すべき
  • ▸ GPT-6 Astraとの比較ではTerminal-Bench同等レベル(59.6% vs 57.9%)— 独立測定では差が縮小

Best Practice Updates

  • ✓ ベンチマークスコアは公式値と独立測定値の両方を参照すべき — effort設定・テスト条件の違いでスコアに乖離が生じる可能性がありモデル選択判断には複数ソースの評価が推奨

Same Day Signals

すべて見る →

元記事の著作権は各著作者に帰属します。