Claude API
Opus 5.5独立ベンチマーク評価が複数機関から公開 — SonarSourceがHumanEval/MBPP 87.7%で27.5%少ないコード生成を確認、CodeRabbit・Cosmic JS・OfficeChai・Vellum等が詳細分析
元記事を読む(sonarsource.com) ↗Summary
9月22日のOpus 5.5リリースから48時間以内に複数の独立ベンチマーク評価が公開。SonarSourceはHumanEval/MBPP 544タスクでOpus 5.5が87.7%パス(Opus 5: 88.6%)ながら27.5%少ないコードで同等品質を達成し40%少ないトークン消費と報告。Artificial AnalysisはIntelligence Indexでmax effort 58のトップスコアを確認しHumanity's Last Exam 61.4%・SciCode 66.9%等10評価中6でリード。CodeRabbit・Cosmic JS・OfficeChai・Kingy AI・Coursiv・Codersera・Vellum等がベンチマーク比較記事を公開。Opus 5.5はSWE-bench Pro 89.9%・Terminal-Bench 66.4%でAnthropic発表値を裏付け。GPT-6 Astra(57.9%)との直接比較で8.5pt優位が独立確認。
Key Takeaways
- ▸ SonarSource独立評価: 27.5%少ないコード・40%少ないトークンで同等品質 — コード効率・コスト効率が定量的に確認
- ▸ Artificial Analysis Intelligence Index max effort 58でトップスコア — 独立ベンチマーク機関による全モデル#1評価
- ▸ GPT-6 Astra比8.5ptリード(Terminal-Bench)が独立確認 — 同日リリースのGPT-6 Sol/Luna価格攻勢にもかかわらずベンチマーク優位は維持
- ▸ SWE-bench Pro 89.9%がAnthropic発表値と一致 — ベンチマーク信頼性が外部検証で裏付け
- ▸ 48時間以内に7機関以上が独立評価を公開 — Opus 5.5への業界注目度の高さ
Best Practice Updates
- ✓ Opus 5.5は同等品質でOpus 5比27.5%少ないコード・40%少ないトークンを消費 — エージェントプロンプトの出力効率が構造的に改善
- ✓ API利用のコスト最適構成が「日常→Sonnet 5 $2/$10・高難度→Opus 5.5 $4/$20」で独立ベンチマーク機関により裏付け
Same Day Signals
すべて見る →- Anthropic Anthropicが生命科学研究グループと実験室を設立しClaude主導でCRISPR様リピートを持つ新規酵素システム「ART」を発見 — 950エージェント・21時間・2.1億トークンでバクテリオファージの未知タンパク質ファミリーを同定
- Anthropic Dario Amodei CEOが国連安全保障理事会でAIリスクを警告 — OpenAI Altmanと共にAI能力・安全性の独立ベンチマーク導入を提言、フランス議長下で初のAI安全保障公式討議
- Claude API OpenAI GPT-6 Sol/LunaとClaude Opus 5.5の90分差同時リリースがAPI価格戦争を加速 — Simon Willison・DEV Community・SiliconANGLE・WCCFTech等がコスト影響を詳細分析
- Anthropic Buist v. Anthropic反トラスト訴訟が国際報道でさらに拡大 — Bloomberg Law・TNW・TradingKey・Eastern Heraldが法的詳細を分析、11月IPOへの影響に注目
元記事の著作権は各著作者に帰属します。