Daily Log

2026年7月26日(日)

8 signals received

Claude API

Claude API新機能: Mid-conversation Tool Changes(ベータ)でエージェントのプログレッシブ・ディスクロージャーパターンが実現 — ツール追加・削除をプロンプトキャッシュ維持しつつ会話中に動的制御

Opus 5リリースと同時にmid-conversation tool changes(ベータ)が全対応モデル(Fable 5・Mythos 5・Opus 4.8・Opus 5)で利用可能に。`mid-conversation-tool-changes-2026-07-01`ベータヘッダーで有効化。会話のツール一覧を初回に全定義した上で、ターン間で`tool_addition`・`tool_removal`ブロックを使い特定ツールの有効化・無効化を動的に制御。プロンプトキャッシュを維持しつつツール構成を変更可能。既存のmid-conversation system messagesとの組み合わせでエージェントの行動制御がターン単位で精密化。Claude API・Amazon Bedrock・Google Cloudの全プロバイダーで利用可能。

Claude API

Claude API新機能: Default Fallbacksモード(ベータ)で安全性分類器によるrefusalの自動フォールバックルーティングが実現 — モデルリスト管理不要の「おまかせ」フォールバック

Opus 5リリースと同時にserver-side fallbackの`"default"`モードが追加(`server-side-fallback-2026-07-01`ベータヘッダー)。`fallbacks`パラメータに`"default"`を指定すると、安全性分類器がリクエストをブロックした際にAnthropicが推奨するフォールバックモデルにrefusalカテゴリ別で自動ルーティング。従来のexplicit-list形式(特定モデルを明示指定)に加え、Anthropicの推奨に追従する「おまかせ」モードが選択可能に。推奨モデルリストはAnthropic側で更新されるためクライアント側のメンテナンスが不要。Opus 5・Fable 5の安全性分類器誤検知時のフォールバックがシームレスに実現。

MCP

MCP 2026-07-28最終仕様公開まで残り2日 — 12ヶ月猶予期間付きdeprecationでsampling・roots・logging廃止、ステートレスコア+Extensions Framework正式化

MCP 2026-07-28最終仕様公開まで残り2日。Release Candidateは5月21日から10週間の検証期間を経て7月28日に確定。主要変更の最終確認: (1)ステートレスコア — `initialize`ハンドシェイク・`Mcp-Session-Id`廃止でスティッキーセッション不要、通常のラウンドロビンロードバランサーで運用可能に、(2)deprecated機能(sampling・roots・logging)は12ヶ月の機能維持猶予付き — 即時破壊はなし、(3)Extensions Frameworkが正式化 — MCP Apps(サンドボックスHTML UI)・Tasks(長時間ジョブ管理)がextensionとして位置づけ、(4)OAuth 2.1が認証標準に昇格 — 6つのSpecification Enhancement Proposalで認可フレームワーク強化。Beta SDK: Python v2.0.0b1・TypeScript v2(ESM-only・パッケージ分割)・Go v1.7.0-pre.1・C# v2.0.0-preview.1。10,000超パブリックサーバー・月間9,700万SDKダウンロードのエコシステムに影響。

Claude API

Opus 5 vs GPT-5.6 Sol詳細ベンチマーク比較 — SWE-bench Pro +14.6pt・ARC-AGI 3で3.9倍・12ベンチマーク中9勝でOpus 5が$5/$25の価格優位と共に総合リード

Opus 5リリース後のコミュニティ詳細ベンチマーク比較が集約。Opus 5($5/$25)vs GPT-5.6 Sol($5/$30)の直接比較: SWE-bench Pro 79.2% vs 64.6%(+14.6pt)、ARC-AGI 3 30.2% vs 7.8%(3.9倍)、Frontier-Bench 43.3% vs 34.4%、GDPval-AA v2 Elo 1,861 vs n/a。12ベンチマーク中9つでOpus 5がリード。CursorBench 3.2でFable 5($10/$50)の0.5%差に迫りコスト効率で圧倒。AutomationBenchで

Claude API

Fortune: Opus 5のeffortダイヤルがB2Bチームの「AIコスト対能力トレードオフ」を初めてユーザー制御可能に — エンタープライズAI予算管理の新パラダイム

Fortune(7月24日)がOpus 5のeffortダイヤルをB2Bチーム向けの予算管理ツールとして分析。Opus 5はlow/medium/high/xhigh/maxの5段階effortダイヤルをベータヘッダー不要で全ユーザーに提供。lowでは高速・低コスト応答、maxではFable 5に迫る性能を$5/$25で実現。Fast Mode(Research Preview)は2.5倍速・$10/$50でさらなる高速化オプション。Fortuneは「AI予算がブラックボックスだった企業が初めてタスク別のコスト・品質トレードオフを明示的にコントロール可能に」と評価。Uberの$3.4B予算超過・Microsoft E+D部門の$500-2,000/月/エンジニアの事例を踏まえ、effortダイヤルがエンタープライズAI予算の予測可能性を根本的に改善すると分析。

Anthropic

TechTimes: Opus 5がUK AISI政府サイバーテストでエンタープライズネットワーク攻撃を8/10回完遂 — 最低ミスアラインメントスコアと高サイバー能力の二面性が「運用管理強化」を要求

TechTimes(7月25日)がOpus 5 System Cardの中でも特にサイバーセキュリティ能力に焦点を当てて報道。UK AI Security Institute(AISI)がOpus 5の早期スナップショットで3つのマルチステップ・サイバーレンジ(エンタープライズネットワーク攻撃シミュレーション)を実施し、10回中8回で攻撃パス全体を完遂。UK AISIはOpus 5をMythos 5・Mythos Previewと「同等の能力ティア」に分類。一方でOpus 5のミスアラインメントスコア2.30は全Claudeモデル最低(最良)で、Opus 4.8(2.85)・Mythos 5(2.81)・Sonnet 5(3.35)を上回る。「最も整合的なモデルが高いサイバー攻撃能力を持つ」という二面性が浮き彫りに。Anthropicは自律性脅威モデル1をOpus 5に適用し、ASL-3保護レベル(Opus 4.8と同一)を維持。CyScenarioBench・ExploitGymの新規ベンチマークでサイバーセキュリティ能力の定量評価が標準化。

Claude API

Artificial Analysis: Opus 5がIntelligence Index・Agentic Index共に#1を獲得 — 586モデル中首位、Fable 5を上回りCost per Taskで26%優位

7月25日にArtificial AnalysisがOpus 5の独立評価結果を公開。Intelligence Index v4.1でスコア61を記録し、586モデル中#1を獲得。Fable 5(60)・GPT-5.6 Sol(59)・Kimi K3(57)を上回る。Agentic Indexでも55.3で首位(GPT-5.6 Sol: 54.0、Fable 5: 52.8)。独自ベンチマークAA-Briefcase(エージェンティック知識作業)ではElo 1720を記録し、Fable 5(1574)に146ポイント差。GDPval-AA v2とAA-Briefcaseの両方で過去最高スコアを記録。Cost per TaskではFable 5比26%低コストで同等以上の性能を実現。Artificial Analysisはリリース前にAnthropicと協力して評価を実施。「narrowly the most intelligent model」と評価し、Opus 5がフロンティアモデルの価格性能比を根本的に変えたと分析。