Anthropic

Anthropic Frontier Red Team: GLM-5.3(Zhipu AI)がMythos Preview級サイバー攻撃能力を無防備で公開 — ExploitBench 12%・abliteration 100%突破で「オープンウェイトモデルの安全性欠如」が定量実証

元記事を読む(anthropic.com) ↗

Summary

9月29日にAnthropic Frontier Red Team(Fasano・Fleischer・McFaul・Xiao・Gallagher)が

Key Takeaways

  • ▸ GLM-5.3がClaude Mythos Preview級のサイバー攻撃能力を保有 — ExploitBench 12% vs Mythos 14%でほぼ同等
  • ▸ abliteration(重み改変)でセーフガード100%突破 — 約$4,400で拒否率95%→6%に低減可能
  • ▸ Claude APIは全バイパス手法に耐性 — 重み非公開が根本的防御として機能
  • ▸ Zhipu AIの安全性対策の不十分さが定量的に実証 — 6月蒸留攻撃・7月GLM-5.2に続く3回目のAnthropicからのZhipu指摘
  • ▸ 政策提言でProject Glasswing拡大・政府独立テスト・オープンウェイトセーフガード義務化の3点を提示

Best Practice Updates

  • ✓ `/security-review`やClaude Security Pluginを活用しオープンウェイトモデル由来の攻撃コード検出に備える — GLM-5.3 abliteration版が数日で公開される環境では防御側もAIベース検出が必要
  • ✓ Claudeの重み非公開がセーフガード耐性の根本的要因 — API経由利用がセキュリティ上の優位性を持つことが定量的に裏付け

Same Day Signals

すべて見る →

元記事の著作権は各著作者に帰属します。