Claude API

Opus 5.5独立ベンチマーク第3波でSonarSource 27.5%コード削減・CodeRabbit OSS検出率微増を確認 — 公式値vs独立値の乖離がモデル選択における複数ソース参照の必須性を定量実証

元記事を読む(sonarsource.com) ↗

Summary

9月24-27日にSonarSource・CodeRabbit・Vellum・Kingy AI・BenchLM・eesel AI等がOpus 5.5の独立ベンチマーク第3波を公開。SonarSourceはHumanEval/MBPP 87.7%パスで27.5%少ないコード・40%少ないトークン消費を確認。Artificial Analysis Intelligence Index max effort 58で測定史上最高を記録する一方、Terminal-Bench 4.0では59.6%でAnthropic発表値66.4%との6.8pt乖離が継続。Gray Swanセキュリティテストでプロンプトインジェクション成功率がFable 5.1と同率の最低記録。

Key Takeaways

  • ▸ SonarSource: HumanEval/MBPP 87.7%パスで27.5%少ないコード・40%少ないトークン消費 — コード品質とトークン効率の同時改善が独立確認
  • ▸ Artificial Analysis: Intelligence Index max effort 58で測定史上最高・HLE 61.4%・SciCode 66.9%で10評価中6リード — フロンティア地位は独立第三者機関でも確認
  • ▸ Terminal-Bench 4.0: 独立測定59.6% vs Anthropic発表値66.4%で6.8pt乖離が継続 — effort設定・テスト環境の差異が原因の可能性
  • ▸ GPT-6 Astraとの差が独立測定では59.6% vs 57.9%(約1.7pt)に縮小 — 公式発表の8.5ptリードは独立条件では大幅縮小
  • ▸ Gray Swan: プロンプトインジェクション成功率がFable 5.1と同率最低を記録 — セキュリティ面でもフロンティア水準を維持
  • ▸ CodeRabbit: OSSコードレビューで課題検出率微増・精度微減 — ユースケースにより改善度合いが異なることが確認

Best Practice Updates

  • ✓ API利用のモデル選択判断では公式ベンチマークと独立ベンチマークの両方を参照すべき — effort設定による性能差が大きいためeffort設定を明示した評価データを優先
  • ✓ Opus 5.5のトークン効率改善(40%削減)はAPI利用コスト試算に直接影響 — $4/$20の名目価格にトークン効率改善を加味した実効コスト計算を推奨

Same Day Signals

すべて見る →

元記事の著作権は各著作者に帰属します。