Claude API
Opus 5コミュニティ詳細ベンチマーク — SWE-bench Verified 96-97%でGPT-5.6 Sol・Fable 5を上回り、ミスアラインメントスコア2.30が全Claudeモデル最低値
元記事を読む(the-decoder.com) ↗Summary
7月24日のOpus 5リリース後、複数の独立ベンチマーク検証結果が公開。SWE-bench Verified 96.0-97.0%でGPT-5.6 Sol(96.2%)・Fable 5(95.0%)を上回りトップ。SWE-bench Pro 79.2%、SWE-bench Multimodal 59.4%(Opus 4.8: 38.4%から大幅向上)。Frontier-Bench v0.1で43.3%がFable 5(33.7%)・GPT-5.6 Sol(34.4%)・Opus 4.8(21.1%)を大幅に上回る。安全性指標でもミスアラインメントスコア2.30が全Claudeモデル中最低(最良)で、Opus 4.8・Sonnet 5・Fable 5より優れた整合性。The Decoderは「いくつかのベンチマークでFable 5を完全に上回る」と評価。Fortune報道ではeffortダイヤル(low/medium/high)によるコスト対品質のB2Bチーム向けバランス制御を強調。
Key Takeaways
- ▸ SWE-bench Verified 96-97%でソフトウェアエンジニアリングタスクの事実上のトップモデルに — GPT-5.6 Sol・Fable 5を上回る
- ▸ SWE-bench Multimodal 38.4%→59.4%の大幅向上でマルチモーダルコーディングタスクの実用性が飛躍的改善
- ▸ ミスアラインメントスコア2.30は全Claudeモデル最低 — 安全性と性能の両立がFable 5(安全性分類器の誤検知問題あり)より優れたバランス
- ▸ effortダイヤルでB2Bチームがタスク重要度に応じてAPIコストをリアルタイム制御可能
Best Practice Updates
- ✓ SWE-bench Verified 96-97%を踏まえ、大規模コーディングタスクはOpus 4.8からOpus 5への即時移行を推奨 — 性能向上・同価格・安全性改善の三拍子
- ✓ Fable 5の安全性分類器誤検知リスク vs Opus 5のミスアラインメント2.30最低スコアで、安定性重視タスクではOpus 5がFable 5より推奨
Same Day Signals
すべて見る →- Claude API 【速報】Claude Opus 5正式リリース — Fable 5の半額でベンチマーク大半を上回り、full effortラダー(max含む)・thinking常時有効・512トークンキャッシュ最小長を搭載
- Anthropic AMD × Anthropic $5B戦略パートナーシップ — MI450 GPUで最大2GW展開、インフラ十一系統化でAPI可用性の構造的安定化が加速
- Claude Code v2.1.219リリース — Claude Opus 5がデフォルトOpusモデルに・sandbox.network.strictAllowlist追加・DirectoryAddedフック新設
- MCP The Register: MCP 2026-07-28ステートレス移行で「ハードレッスン」からの根本再設計 — 10,000超サーバー・月間9,700万SDKダウンロードのエコシステムに影響
元記事の著作権は各著作者に帰属します。