Daily Log

2026年7月25日(土)

8 signals received

Claude API

【速報】Claude Opus 5正式リリース — Fable 5の半額でベンチマーク大半を上回り、full effortラダー(max含む)・thinking常時有効・512トークンキャッシュ最小長を搭載

7月24日にAnthropicがClaude Opus 5を正式リリース。モデルID `claude-opus-5`でClaude API・Amazon Bedrock・Google Cloud・Microsoft Foundryの全プラットフォームで即日利用可能。価格はOpus 4.8と同じ$5/$25 per MTokで、Fable 5($10/$50)の半額。Frontier-Bench 43.3%(Fable 5: 33.7%・Opus 4.8: 18.7%)でFable 5を大幅に上回り、SWE-bench Proでも1ポイント差に迫る。1Mコンテキスト(デフォルト・最大共に1M)、128K max output tokens。full effortラダー(low/medium/high/xhigh/max)をベータヘッダー不要で利用可能。thinkingが常時有効(adaptive thinkingがデフォルト)で、xhigh/maxではthinking無効化が400エラー(破壊的変更)。プロンプトキャッシュ最小長が1,024→512トークンに短縮。Fast Mode(Research Preview)はAPI直接のみ$10/$50。mid-conversation tool changes(ベータ)、default fallbacksモード(ベータ)も新機能として追加。

Anthropic

AMD × Anthropic $5B戦略パートナーシップ — MI450 GPUで最大2GW展開、インフラ十一系統化でAPI可用性の構造的安定化が加速

7月22日にAMDとAnthropicが戦略パートナーシップを発表。AMDがAnthropicに最大$5Bの戦略的株式投資を実施し、最大2ギガワットのAMD Instinct MI450 Series GPUを展開。最初の1GWは2027年上半期に展開開始。投資は展開マイルストーン達成に連動。Anthropicはテンズ・オブ・ビリオンズ規模のAMD最新AIサーバーチップ購入にコミット。AMDはNVIDIA・Amazon・Googleに加えAnthropicのGPUサプライヤーリストに追加され、NVIDIA一強からの分散が加速。SpaceX($45B/3年)・Amazon・Google・CoreWeave・Snowflake・Akamai・TeraWulf・Meta交渉中に続く十一系統目のインフラパートナー。AMD株は発表後上昇。

Claude Code

v2.1.219リリース — Claude Opus 5がデフォルトOpusモデルに・sandbox.network.strictAllowlist追加・DirectoryAddedフック新設

7月24日にClaude Code v2.1.219リリース。Claude Opus 5(`claude-opus-5`)がデフォルトのOpusモデルに設定され、1Mコンテキスト・Fast Mode($10/$50 per MTok)で利用可能。新機能: (1)`sandbox.network.strictAllowlist`設定追加 — サンドボックス化コマンドのネットワークアクセスでアローリスト外ホストをプロンプトなしで拒否(従来はプロンプト表示)、(2)`DirectoryAdded`フック追加 — `/add-dir`やSDKの`register_repo_root`で新ワーキングディレクトリが登録された際に発火するフックで、ディレクトリ別のセットアップ自動化が可能に。Claude Code利用者は`/model`でOpus 5を選択可能、環境変数`CLAUDE_CODE_MODEL`での設定も対応。

MCP

The Register: MCP 2026-07-28ステートレス移行で「ハードレッスン」からの根本再設計 — 10,000超サーバー・月間9,700万SDKダウンロードのエコシステムに影響

The Register(7月23日)がMCP 2026-07-28仕様改訂の技術的影響を詳報。MCPメンテナーが「ハードレッスン」から学んだ後方互換性のない変更を含む改訂。ステートレスコアにより、スティッキーセッション・共有セッションストア・ディープパケットインスペクションが不要になり通常のラウンドロビンロードバランサーで運用可能に。10,000超のパブリックMCPサーバーが稼働中・月間SDKダウンロード9,700万超のエコシステム規模。正式にdeprecatedとなった機能は最低12ヶ月の機能維持。ただし2026-07-28リビジョンのサーバーと旧クライアント間の相互運用性は保証されない。MCP AppsでサーバーレンダリングHTMLをサンドボックスiframe内に表示、TasksでGitHub Actionsのような長時間ジョブ管理が可能に。

Anthropic

Anthropic Economic Futures Research Fund $200M研究アジェンダ公開 — AI経済影響の5領域・$5-30M規模プロジェクトを支援

7月22日にAnthropicがEconomic Futures Research Fundの$200M研究アジェンダを公開。AI経済影響に対する社会的準備を支援する5つの優先研究領域: (1)企業・職場レベルでのAIの労働者への影響、(2)AI駆動の変化を乗り越える人材支援、(3)AI駆動の雇用喪失に対する所得支援近代化、(4)AI駆動成長における労働者のステーク確保、(5)公共投資の新エビデンス生成。$5-30M規模のプロジェクトを主に支援。同時にEconomic Indexコネクタをclaude.aiで提供開始しAI経済影響データへの直接アクセスが可能に。Gates Foundation($200M・ヘルスケア)に続く2つ目の大規模社会投資。

Claude API

Opus 5コミュニティ詳細ベンチマーク — SWE-bench Verified 96-97%でGPT-5.6 Sol・Fable 5を上回り、ミスアラインメントスコア2.30が全Claudeモデル最低値

7月24日のOpus 5リリース後、複数の独立ベンチマーク検証結果が公開。SWE-bench Verified 96.0-97.0%でGPT-5.6 Sol(96.2%)・Fable 5(95.0%)を上回りトップ。SWE-bench Pro 79.2%、SWE-bench Multimodal 59.4%(Opus 4.8: 38.4%から大幅向上)。Frontier-Bench v0.1で43.3%がFable 5(33.7%)・GPT-5.6 Sol(34.4%)・Opus 4.8(21.1%)を大幅に上回る。安全性指標でもミスアラインメントスコア2.30が全Claudeモデル中最低(最良)で、Opus 4.8・Sonnet 5・Fable 5より優れた整合性。The Decoderは「いくつかのベンチマークでFable 5を完全に上回る」と評価。Fortune報道ではeffortダイヤル(low/medium/high)によるコスト対品質のB2Bチーム向けバランス制御を強調。

Claude Code

v2.1.220リリース — バックグラウンドセッション管理の安定性修正でエージェント長時間運用の信頼性が向上

7月25日にClaude Code v2.1.220リリース。バグ修正と信頼性改善に焦点を当てたリリース。主な修正: (1)完了済みバックグラウンドセッションが`claude rm`やエージェントビューから削除できない問題の修正、(2)非gitフォルダから起動したバックグラウンドセッションがエージェントビューで削除不能になる問題の修正、(3)停止済みバックグラウンドセッションの再オープン時に保存済み会話が復元されない問題の修正、(4)長時間セッションのメモリリーク修正(MCP stdio サーバーstderr蓄積・LSPドキュメント保持・ヘッドレス/SDKセッションの無制限増大)。v2.1.219のOpus 5デフォルト化翌日のフォローアップリリースとしてバックグラウンドエージェント運用の基盤を安定化。

Claude API

Opus 5 System Card公開 — ASL-3保護・安全性分類器Fable 5比85%低エンゲージメント・30日データ保持義務なし・CB-1分類でセキュリティと利便性を両立

7月24日にAnthropicがClaude Opus 5 System Cardを公開。主要な安全性評価結果: (1)ASL-3保護レベル(Opus 4.8と同一)でResponsible Scaling Policy準拠、(2)安全性分類器のエンゲージメント頻度がFable 5比85%低減 — Fable 5の誤検知問題(正規リクエストのOpus 4.8リルート)がOpus 5では大幅に緩和、(3)30日データ保持義務なし — Fable 5・Mythos 5には必須の30日データ保持がOpus 5には不適用、プライバシー要件の厳しいワークロードに適合、(4)化学・生物兵器リスクはCB-1分類(既知兵器合成に関連するがCB-2「新規兵器合成」には該当せず)でMythos 5のCBリスクを超えない、(5)新規追加ベンチマークCyScenarioBench・ExploitGymでサイバーセキュリティ能力を評価 — Opus 4.8を上回るがMythos 5には及ばない、脆弱性特定は改善するも悪用能力は限定的、(6)プロンプトインジェクション耐性がコーディング・コンピュータユース・ブラウザユースの全カテゴリで最大の改善。UK AI Security Instituteの外部サイバーレンジテストも実施。