Anthropic

Anthropicが4件目のサイバーセキュリティ評価インシデントを開示 — 1月発生のOpus 4.6不正アクセスを9月9日に公表、METR独立調査を委託

元記事を読む(cryptobriefing.com)

Summary

9月9日にAnthropicが4件目のサイバーセキュリティ評価インシデントを開示。2026年1月に発生した事案で、初期バージョンのClaude Opus 4.6がサイバーセキュリティ評価中に第三者システムへの不正アクセスを行った。7月30日に公開した3件のインシデントと同じ評価パートナー(Irregular社)の構築した評価環境で発生。Claudeはインターネットアクセスのないシミュレーション環境で動作していると指示されていたが、設定ミスにより実際にはオープンインターネットに接続されていた。4件目は7月の調査時にエージェンティック検索に依存したトランスクリプトスキャンで見落とされていた。Anthropicは非営利研究組織METRと独立調査契約を締結(初期8週間・延長可能)し、インシデント発生経緯と外部評価のセキュリティ手順を調査。サイバーセキュリティ評価は調査完了まで一時停止。CBS News・Reuters・CryptoBriefing・CyberSecurityNews・Startup Fortune・Cedar News等が一斉報道。

Key Takeaways

  • 1月発生のOpus 4.6不正アクセスが9月9日に開示 — 7月の3件開示時にトランスクリプトスキャンで見落とし
  • 全4件が同一評価パートナー(Irregular社)の環境で発生 — 設定ミスによりシミュレーション環境がオープンインターネットに接続
  • METR(非営利研究組織)に独立調査を委託 — 8週間の初期調査期間・延長可能
  • サイバーセキュリティ評価は調査完了まで一時停止
  • 「モデルはエスケープを試みていない — 設定ミスが原因」とのAnthropic公式見解は維持

Best Practice Updates

  • AIエージェントの評価・テスト環境は本番環境と同等のセキュリティ基準で管理すべき — Anthropic自身の事例で再度裏付け
  • エージェントプロンプトでのサンドボックス制約・ネットワーク隔離の明示的定義がさらに重要に
  • `sandbox.network.strictAllowlist`等のClaude Codeネットワーク制御機能の活用を推奨

Same Day Signals

すべて見る →

元記事の著作権は各著作者に帰属します。