Claude API

Opus 5コミュニティ初期レビューが「ベンチマーク首位だが使いにくい」で二分 — SWE-bench Verified 97%・Intelligence Index #1でも「over-eager」「neurotic」の批判が顕在化

元記事を読む(leadwithai.co)

Summary

Opus 5リリース後72時間のコミュニティ反応が複数メディアで集約。Hacker Newsで1,378ポイント・746コメントを記録し「異例の関心度」。ベンチマーク面ではSWE-bench Verified 97.00%(GPT-5.6 Sol: 96.20%・Fable 5: 95.00%)で首位、Artificial Analysis Intelligence Index 61で586モデル中#1と客観的指標では圧倒的。一方で実用面では批判が顕在化: (1)「How I AI」ホストClaire Voが「hate working with it」と評価 — 性格が「neurotic and insanely timid」で矛盾する指示に対しタスク放棄する傾向、ただしブラインドテストではFable 5・GPT-5.6を含む全モデル中#1に選出、(2)Lenny's Newsletterが「brilliant (but annoying)」と評価 — 求めていないイニシアティブを取り・長い応答を生成し・矛盾する指示で停止する傾向、(3)X(旧Twitter)ではmedium effortの品質とトークン効率に対する好意的反応が多い一方、Reddit・Hacker Newsではusage limits・モデル入れ替え頻度・安全性フォールバックへの懸念が中心。「ベンチマーク#1でも日常的な使いやすさでは改善余地あり」のパターンはFable 5リリース時と類似。

Key Takeaways

  • SWE-bench Verified 97%は全AIモデル中トップだが、実用面では「over-eager(過剰に積極的)」「neurotic(神経質)」の批判がコミュニティで多数 — ベンチマーク性能と日常的ユーザー体験のギャップが課題
  • Claire Voのブラインドテスト#1評価は「不快でも品質は高い」ことを示唆 — 応答スタイルのプロンプト制御(簡潔さ・自律行動範囲の制限)がOpus 5活用の鍵
  • medium effortが日常コーディングの「スイートスポット」として支持拡大 — high/maxは必要な場合のみ使用が実用的なコンセンサスに
  • モデル入れ替え頻度(Opus 4.7→4.8→5が約2ヶ月間隔)への疲弊感が一部コミュニティで表出

Best Practice Updates

  • Opus 5の「over-eager」傾向にはプロンプトで行動範囲を明示的に制限(「要求された変更のみ実行」「追加機能を提案しない」等)が有効
  • ブラインドテスト#1の結果を踏まえOpus 5は品質面では信頼できるが応答スタイルのプロンプト調整が活用の前提条件

Same Day Signals

すべて見る →

元記事の著作権は各著作者に帰属します。