Claude API

Claude Sonnet 5リリース — 「最もエージェンティックなSonnet」がOpus 4.8に迫る性能を$2/$10の導入価格で提供、Claude Code・全有料プランのデフォルトモデルに

元記事を読む(anthropic.com)

Summary

6月30日、AnthropicがClaude Sonnet 5(`claude-sonnet-5`)をリリース。「最もエージェンティックなSonnetモデル」として、計画立案・ブラウザ/ターミナル等ツール活用・自律実行の能力が大幅に向上し、数ヶ月前までOpusクラスでしか実現できなかったレベルのエージェンティック性能を中価格帯で実現。1Mトークンコンテキストウィンドウ・128K最大出力トークン。8月31日までの導入価格$2/$10 per MTok(以降$3/$15)。Claude.ai・Claude Code・Bedrock・Vertex AI・Foundryで即日利用可能。無料・Proプランのデフォルトモデルに設定。安全性面ではSonnet 4.6より全体的に望ましくない行動の発生率が低下し、エージェンティックな文脈での安全性が向上。

Key Takeaways

  • SWE-bench Pro: 63.2%(Sonnet 4.6: 58.1%、Opus 4.8: 69.2%) — コーディングエージェント性能でOpus 4.8の90%水準に到達
  • SWE-bench Verified: 85.2%(Opus 4.8: 88.6%) — 検証済みベンチマークでもOpus 4.8に接近
  • OSWorld-Verified: 81.2%(Sonnet 4.6: 78.5%) — コンピュータ操作タスクで改善
  • Terminal-Bench 2.1: 80.4(Sonnet 4.6: 74.6) — コマンドラインワークフローで大幅向上
  • 導入価格$2/$10はOpus 4.8($15/$75)の約7分の1 — エージェント大量デプロイのコスト障壁が大幅低下
  • Sonnet 4.6比で全ベンチマーク改善、推論+ツール利用・知識作業でOpus 4.8に匹敵またはわずかに上回る領域も

Best Practice Updates

  • エージェント大量デプロイ・並列タスク・コスト重視ワークロードはSonnet 5が最適選択肢 — Opus 4.8の約7分の1のコストで90%水準の性能
  • 高難度タスク(大規模リファクタリング・フロンティアリサーチ)は引き続きOpus 4.8が最適 — SWE-bench Pro 69.2% vs 63.2%で依然優位
  • Advisor Toolパターン(Sonnet 5エグゼキューター+Opus 4.8アドバイザー)が新たなコスト最適構成として有力 — Sonnet 4.6→Sonnet 5への置き換えで性能向上とコスト維持を同時達成

Same Day Signals

すべて見る →

元記事の著作権は各著作者に帰属します。