Anthropic
Anthropicが「Fable 5サイバーセーフガードとジェイルブレイクフレームワーク」の技術詳細を公開 — CJSスケール(CJS-0〜CJS-4)の4軸スコアリングで業界標準を提案
元記事を読む(anthropic.com) ↗Summary
7月3日にAnthropicがFable 5復旧に伴う安全性対策の技術詳細を公開。新サイバーセキュリティ分類器の設計思想と性能、およびAmazon・Microsoft・Google等のGlasswingパートナーと共同提案するCyber Jailbreak Severity(CJS)スケールの全容を解説。CJSスケールはNone(CJS-0)からCritical(CJS-4)の5段階で指数的重大度を設定し、4軸(能力獲得度:既存ツールを超える程度、影響範囲:同一手法が有効な攻撃タスク数、武器化容易性:実攻撃への転換に必要な人的労力、独立発見可能性:手法の入手容易さ)でスコアリング。最重大クラス(重要インフラへの積極的攻撃利用)には重大度確認時点から即座にミティゲーション展開を開始し、24時間体制のジェイルブレイク監視チームを設置。バグバウンティプログラムで外部研究者に分類器回避手法の発見を奨励し、脅威インテリジェンスで攻撃者の適応を継続追跡。
Key Takeaways
- ▸ CJSスケール(CJS-0〜CJS-4)の4軸スコアリングフレームワークがCVSSのAIジェイルブレイク版として業界標準化を目指す
- ▸ Amazon・Microsoft・Google等のGlasswingパートナーとの共同提案で業界横断の合意形成を推進
- ▸ CJS-4(重要インフラへの積極的攻撃利用)には確認即時のミティゲーション展開+24時間監視チームで対応
- ▸ バグバウンティ+脅威インテリジェンスの継続的改善サイクルで分類器の実効性を維持
Best Practice Updates
- ✓ CJSスケールの4軸をセキュリティAPIアプリケーションのリスク評価に参照 — 自社AIセキュリティ設計でジェイルブレイクトリアージプロセスの標準化に活用
- ✓ 分類器の誤検知対策として防御的フレーミング(脆弱性修正・コードレビュー等の意図明示)が引き続き重要
- ✓ 業界横断フレームワーク確立後はモデル非依存のセキュリティ評価が可能に — マルチプロバイダー設計の安全性比較基盤として活用
Same Day Signals
すべて見る →- Claude Code Dynamic Workflows GAでPro含む全有料プランに拡大 — 最大1,000並列サブエージェントのオーケストレーションが$20/月プランから利用可能に
- MCP MCP 2026-07-28仕様リリース候補のBeta SDKが4言語で公開 — ステートレスプロトコルコアへの移行とExtensions Frameworkで大規模改訂
- MCP NSAがMCPセキュリティ設計ガイダンスを公開 — エージェンティックAIデプロイメントの政府レベル最小セキュリティベースラインが確立
- Anthropic Fable 5停止19日間の教訓がエンタープライズAIインフラ設計の標準参照に — 「AIモデルは公共インフラと同等の可用性設計が必要」
元記事の著作権は各著作者に帰属します。