Claude API

Opus 5.5独立ベンチマーク評価が複数機関から公開 — SonarSourceがHumanEval/MBPP 87.7%で27.5%少ないコード生成を確認、CodeRabbit・Cosmic JS・OfficeChai・Vellum等が詳細分析

元記事を読む(sonarsource.com)

Summary

9月22日のOpus 5.5リリースから48時間以内に複数の独立ベンチマーク評価が公開。SonarSourceはHumanEval/MBPP 544タスクでOpus 5.5が87.7%パス(Opus 5: 88.6%)ながら27.5%少ないコードで同等品質を達成し40%少ないトークン消費と報告。Artificial AnalysisはIntelligence Indexでmax effort 58のトップスコアを確認しHumanity's Last Exam 61.4%・SciCode 66.9%等10評価中6でリード。CodeRabbit・Cosmic JS・OfficeChai・Kingy AI・Coursiv・Codersera・Vellum等がベンチマーク比較記事を公開。Opus 5.5はSWE-bench Pro 89.9%・Terminal-Bench 66.4%でAnthropic発表値を裏付け。GPT-6 Astra(57.9%)との直接比較で8.5pt優位が独立確認。

Key Takeaways

  • SonarSource独立評価: 27.5%少ないコード・40%少ないトークンで同等品質 — コード効率・コスト効率が定量的に確認
  • Artificial Analysis Intelligence Index max effort 58でトップスコア — 独立ベンチマーク機関による全モデル#1評価
  • GPT-6 Astra比8.5ptリード(Terminal-Bench)が独立確認 — 同日リリースのGPT-6 Sol/Luna価格攻勢にもかかわらずベンチマーク優位は維持
  • SWE-bench Pro 89.9%がAnthropic発表値と一致 — ベンチマーク信頼性が外部検証で裏付け
  • 48時間以内に7機関以上が独立評価を公開 — Opus 5.5への業界注目度の高さ

Best Practice Updates

  • Opus 5.5は同等品質でOpus 5比27.5%少ないコード・40%少ないトークンを消費 — エージェントプロンプトの出力効率が構造的に改善
  • API利用のコスト最適構成が「日常→Sonnet 5 $2/$10・高難度→Opus 5.5 $4/$20」で独立ベンチマーク機関により裏付け

Same Day Signals

すべて見る →

元記事の著作権は各著作者に帰属します。