Claude API

Claude Sonnet 5 System Card: ブラウザユースでのプロンプトインジェクション攻撃成功率が31.5%→0.93%に大幅低下 — エージェンティック安全性の新基準を確立

元記事を読む(anthropic.com)

Summary

Claude Sonnet 5のSystem Card分析で、エージェンティック安全性が大幅に向上していることが判明。ブラウザユースシナリオでのプロンプトインジェクション攻撃成功率がOpus 4.8(セーフガードなし)の31.5%からSonnet 5では0.93%に低下(約34倍改善)。悪意あるリクエストの拒否率もSonnet 4.6の76.60%からSonnet 5で92.37%に15.77pt向上。さらにadaptive thinkingがデフォルトで常時有効化され、モデルが推論の深さをリクエストごとに自動判断。

Key Takeaways

  • ブラウザユースでのプロンプトインジェクション攻撃成功率が31.5%→0.93%(約34倍改善)
  • 悪意あるリクエスト拒否率が76.60%→92.37%に向上(+15.77pt)
  • adaptive thinking常時有効化でモデルが推論深度を自動判断 — 明示的thinking指示が不要に
  • Zapier・Zedが実運用でエージェンティック性能向上を確認

Best Practice Updates

  • ブラウザユースエージェントのセキュリティ設計でSonnet 5が新たな安全性基準に — プロンプトインジェクション耐性の大幅向上でWebスクレイピング・ブラウザ操作タスクの信頼性が向上
  • adaptive thinking常時有効化により「段階的に考えて」等の思考制御スキャフォールディングが不要 — プロンプト簡素化とコスト効率改善が同時達成
  • エージェント大量デプロイの安全性がSonnet 5で実用水準に到達 — Sonnet 5デフォルト+Opus 4.8高難度の二層構成が安全性とコストの両面で最適

Same Day Signals

すべて見る →

元記事の著作権は各著作者に帰属します。