Anthropic

Anthropicが「Fable 5サイバーセーフガードとジェイルブレイクフレームワーク」の技術詳細を公開 — CJSスケール(CJS-0〜CJS-4)の4軸スコアリングで業界標準を提案

元記事を読む(anthropic.com)

Summary

7月3日にAnthropicがFable 5復旧に伴う安全性対策の技術詳細を公開。新サイバーセキュリティ分類器の設計思想と性能、およびAmazon・Microsoft・Google等のGlasswingパートナーと共同提案するCyber Jailbreak Severity(CJS)スケールの全容を解説。CJSスケールはNone(CJS-0)からCritical(CJS-4)の5段階で指数的重大度を設定し、4軸(能力獲得度:既存ツールを超える程度、影響範囲:同一手法が有効な攻撃タスク数、武器化容易性:実攻撃への転換に必要な人的労力、独立発見可能性:手法の入手容易さ)でスコアリング。最重大クラス(重要インフラへの積極的攻撃利用)には重大度確認時点から即座にミティゲーション展開を開始し、24時間体制のジェイルブレイク監視チームを設置。バグバウンティプログラムで外部研究者に分類器回避手法の発見を奨励し、脅威インテリジェンスで攻撃者の適応を継続追跡。

Key Takeaways

  • CJSスケール(CJS-0〜CJS-4)の4軸スコアリングフレームワークがCVSSのAIジェイルブレイク版として業界標準化を目指す
  • Amazon・Microsoft・Google等のGlasswingパートナーとの共同提案で業界横断の合意形成を推進
  • CJS-4(重要インフラへの積極的攻撃利用)には確認即時のミティゲーション展開+24時間監視チームで対応
  • バグバウンティ+脅威インテリジェンスの継続的改善サイクルで分類器の実効性を維持

Best Practice Updates

  • CJSスケールの4軸をセキュリティAPIアプリケーションのリスク評価に参照 — 自社AIセキュリティ設計でジェイルブレイクトリアージプロセスの標準化に活用
  • 分類器の誤検知対策として防御的フレーミング(脆弱性修正・コードレビュー等の意図明示)が引き続き重要
  • 業界横断フレームワーク確立後はモデル非依存のセキュリティ評価が可能に — マルチプロバイダー設計の安全性比較基盤として活用

Same Day Signals

すべて見る →

元記事の著作権は各著作者に帰属します。