Anthropic

Anthropic Frontier Red TeamがGLM-5.3のMythos Preview級サイバー攻撃能力を定量分析 — abliteration 100%突破でオープンウェイトモデルのセーフガード限界を実証

元記事を読む(anthropic.com) ↗

Summary

9月29日にAnthropic Frontier Red Teamが

Key Takeaways

  • ▸ GLM-5.3のExploitBench 12%はMythos Preview 14%と同等水準
  • ▸ セーフガードバイパス成功率: 直接要求0%→欺瞞的カバーストーリー64%→プリフィル92%→abliteration 100%
  • ▸ abliteration(安全性微調整の除去)は約$4,400・数時間で拒否率95%→6%に低下
  • ▸ Claude APIは全バイパス手法に耐性維持 — 重み非公開が根本的防御
  • ▸ 政策提言としてProject Glasswing拡大・政府独立テスト・オープンウェイトセーフガード義務化の3点を提示

Best Practice Updates

  • ✓ オープンウェイトモデルのセーフガードは構造的に限界あり — セキュリティクリティカルなタスクにはClaude API(重み非公開)の利用が推奨

Same Day Signals

すべて見る →

元記事の著作権は各著作者に帰属します。