Claude API
Opus 5.5独立ベンチマーク評価の第2波 — Artificial AnalysisがIntelligence Index 58でmax effort首位を確認もTerminal-Bench 59.6%でAnthropic発表値66.4%との乖離を指摘、独立検証の重要性が再確認
元記事を読む(vellum.ai) ↗Summary
9月24-25日にVellum・OfficeChai・Orcarouter・Technology Org・Trendingtopics.eu等がOpus 5.5の独立ベンチマーク詳細分析を公開。Artificial AnalysisはIntelligence Index max effortで58の測定史上最高スコアを確認しHumanity's Last Exam 61.4%・SciCode 66.9%等10評価中6でリード。一方Terminal-Bench 4.0では59.6%と測定しAnthropic発表値66.4%との間に6.8pt乖離が存在 — テスト条件(effort設定・セットアップ)の違いが原因の可能性。Vellumは「独立測定値がAnthropic発表値より控えめ」と明示的に指摘しベンチマーク評価には独立第三者検証が重要と強調。OfficeChai・Orcarouterも各ベンチマークスコアのソースを網羅的に整理。
Key Takeaways
- ▸ Artificial Analysis Intelligence Index max effort 58で測定史上最高 — 独立第三者機関によるトップスコア確認
- ▸ Terminal-Bench 59.6% vs Anthropic発表値66.4%で6.8pt乖離 — テスト条件の違いが原因の可能性だが独立検証の重要性を示唆
- ▸ HLE 61.4%・SciCode 66.9%で10評価中6リード — 科学・推論タスクでの優位性は独立確認
- ▸ Vellumが「独立値はAnthropic発表値より控えめ」と明示 — ベンチマーク評価には公式値と独立値の両方を参照すべき
- ▸ GPT-6 Astraとの比較ではTerminal-Bench同等レベル(59.6% vs 57.9%)— 独立測定では差が縮小
Best Practice Updates
- ✓ ベンチマークスコアは公式値と独立測定値の両方を参照すべき — effort設定・テスト条件の違いでスコアに乖離が生じる可能性がありモデル選択判断には複数ソースの評価が推奨
Same Day Signals
すべて見る →- Claude Code Claude Code v2.1.282リリースでmaxProseWidth設定・テレメトリ変数可視化・Chrome MCP共存設定が追加 — 51連続安定化リリースでCI/CDターゲットはv2.1.282に更新推奨
- Anthropic Anthropic・OpenAI・Google DeepMindが「Standards Authority for Frontier AI」設立を協議 — 自主的業界安全基準団体が2026年末〜2027年にローンチ予定、政府監督なしの独立評価体制を構想
- Anthropic Amodei国連安保理で「AIリリース速度を安全性確保に必要なだけ減速する」と公式宣言 — France24・CNN・CNBC等が追加詳細を報道、AIインシデント国際通報制度とAI能力の共通テスト基準を提言
- Anthropic Anthropic Instituteが「AI開発ペース測定メトリクス」を公開 — 30,000同時稼働エージェント・10億決定中0.002%ブロック・R&D 26%リードの3指標で再帰的自己改善の進行度を定量化
元記事の著作権は各著作者に帰属します。