Claude API

Opus 5コミュニティ詳細ベンチマーク — SWE-bench Verified 96-97%でGPT-5.6 Sol・Fable 5を上回り、ミスアラインメントスコア2.30が全Claudeモデル最低値

元記事を読む(the-decoder.com)

Summary

7月24日のOpus 5リリース後、複数の独立ベンチマーク検証結果が公開。SWE-bench Verified 96.0-97.0%でGPT-5.6 Sol(96.2%)・Fable 5(95.0%)を上回りトップ。SWE-bench Pro 79.2%、SWE-bench Multimodal 59.4%(Opus 4.8: 38.4%から大幅向上)。Frontier-Bench v0.1で43.3%がFable 5(33.7%)・GPT-5.6 Sol(34.4%)・Opus 4.8(21.1%)を大幅に上回る。安全性指標でもミスアラインメントスコア2.30が全Claudeモデル中最低(最良)で、Opus 4.8・Sonnet 5・Fable 5より優れた整合性。The Decoderは「いくつかのベンチマークでFable 5を完全に上回る」と評価。Fortune報道ではeffortダイヤル(low/medium/high)によるコスト対品質のB2Bチーム向けバランス制御を強調。

Key Takeaways

  • SWE-bench Verified 96-97%でソフトウェアエンジニアリングタスクの事実上のトップモデルに — GPT-5.6 Sol・Fable 5を上回る
  • SWE-bench Multimodal 38.4%→59.4%の大幅向上でマルチモーダルコーディングタスクの実用性が飛躍的改善
  • ミスアラインメントスコア2.30は全Claudeモデル最低 — 安全性と性能の両立がFable 5(安全性分類器の誤検知問題あり)より優れたバランス
  • effortダイヤルでB2Bチームがタスク重要度に応じてAPIコストをリアルタイム制御可能

Best Practice Updates

  • SWE-bench Verified 96-97%を踏まえ、大規模コーディングタスクはOpus 4.8からOpus 5への即時移行を推奨 — 性能向上・同価格・安全性改善の三拍子
  • Fable 5の安全性分類器誤検知リスク vs Opus 5のミスアラインメント2.30最低スコアで、安定性重視タスクではOpus 5がFable 5より推奨

Same Day Signals

すべて見る →

元記事の著作権は各著作者に帰属します。