Anthropic
Anthropic Frontier Red TeamがGLM-5.3のMythos Preview級サイバー攻撃能力を定量分析 — abliteration 100%突破でオープンウェイトモデルのセーフガード限界を実証
元記事を読む(anthropic.com) ↗Summary
9月29日にAnthropic Frontier Red Teamが
Key Takeaways
- ▸ GLM-5.3のExploitBench 12%はMythos Preview 14%と同等水準
- ▸ セーフガードバイパス成功率: 直接要求0%→欺瞞的カバーストーリー64%→プリフィル92%→abliteration 100%
- ▸ abliteration(安全性微調整の除去)は約$4,400・数時間で拒否率95%→6%に低下
- ▸ Claude APIは全バイパス手法に耐性維持 — 重み非公開が根本的防御
- ▸ 政策提言としてProject Glasswing拡大・政府独立テスト・オープンウェイトセーフガード義務化の3点を提示
Best Practice Updates
- ✓ オープンウェイトモデルのセーフガードは構造的に限界あり — セキュリティクリティカルなタスクにはClaude API(重み非公開)の利用が推奨
Same Day Signals
すべて見る →- Anthropic Claude Frontier Academy発表 — Anthropicが$100M投資で10,000名のFrontier Deployed Engineer育成、医療レジデンシーモデルでエンタープライズAI人材ギャップに対処
- Claude Code Claude Code v2.1.287リリースでMods(モッド)機能が追加 — TypeScriptモジュールでClaude CodeのUI・動作・機能をプラグイン内から完全カスタマイズ可能に
- Claude Code Claude Code Projects(ベータ)で並列スレッド・共有メモリ・コーディネーターによるマルチセッション管理が実現
- Anthropic Claude for Government Desktop GA移行が10月4日に発効 — FedRAMP High環境でClaude Code+Coworkが全政府組織に本番提供
元記事の著作権は各著作者に帰属します。