Anthropic
Anthropic Frontier Red Team: GLM-5.3(Zhipu AI)がMythos Preview級サイバー攻撃能力を無防備で公開 — ExploitBench 12%・abliteration 100%突破で「オープンウェイトモデルの安全性欠如」が定量実証
元記事を読む(anthropic.com) ↗Summary
9月29日にAnthropic Frontier Red Team(Fasano・Fleischer・McFaul・Xiao・Gallagher)が
Key Takeaways
- ▸ GLM-5.3がClaude Mythos Preview級のサイバー攻撃能力を保有 — ExploitBench 12% vs Mythos 14%でほぼ同等
- ▸ abliteration(重み改変)でセーフガード100%突破 — 約$4,400で拒否率95%→6%に低減可能
- ▸ Claude APIは全バイパス手法に耐性 — 重み非公開が根本的防御として機能
- ▸ Zhipu AIの安全性対策の不十分さが定量的に実証 — 6月蒸留攻撃・7月GLM-5.2に続く3回目のAnthropicからのZhipu指摘
- ▸ 政策提言でProject Glasswing拡大・政府独立テスト・オープンウェイトセーフガード義務化の3点を提示
Best Practice Updates
- ✓ `/security-review`やClaude Security Pluginを活用しオープンウェイトモデル由来の攻撃コード検出に備える — GLM-5.3 abliteration版が数日で公開される環境では防御側もAIベース検出が必要
- ✓ Claudeの重み非公開がセーフガード耐性の根本的要因 — API経由利用がセキュリティ上の優位性を持つことが定量的に裏付け
Same Day Signals
すべて見る →- Anthropic Claude大規模障害(9月29-30日): claude.ai・Claude Code・Cowork・APIで広範なエラー — Sonnet 5.5リリース翌日に発生、サインイン・セッション開始に影響
- Claude API Claude Sonnet 5.5 API移行で5つの破壊的変更 — Thinking Mode無効化方法変更・Forced Tool Use廃止・Account-Bound Thinking Blocks導入でSonnet 5からの移行に注意が必要
- Anthropic Anthropic IPO公開S-1のEDGAR提出が10月初旬見込み — マーケティング開始は10月中旬、中間選挙前の11月上場タイムラインが確定的
- Anthropic Claude Sonnet 5.5の安全性機能とDC Circuit判決の交差がIPOリスク要因を複合化 — Sonnet初のサイバーセーフガードが防衛セクター排除判決と並列で分析
元記事の著作権は各著作者に帰属します。