Anthropic

【速報】Anthropic安全性研究者Jacob Coxonが退職・AI存亡リスクを警告 — 「自己改善型超知性に向かって突き進んでいる」とSlack・X(76M閲覧)で公開、Evan Hubingerは「超知性のアライメント計画はまだない」と認める

元記事を読む(bloomberg.com)

Summary

9月9日にAnthropicの事前学習研究者Jacob Coxonが退職を公表。OpenAIとAnthropicの両社で3年間事前学習研究に従事した後、「どちらの企業も責任ある行動をしていない」「自己改善型超知性に直進しており我々の命を賭けている」とSlack社内メッセージとX(旧Twitter)の7パート投稿で警告。X投稿は一晩で約7,600万閲覧を記録。Wall Street Journal独占インタビューも同日掲載。Anthropicのアライメントサイエンスリードの一人であるEvan Hubingerは一部の主張に反論しつつも「超知性のアライメントを解決する計画はまだなく、明確に軌道に乗っているとは言えない」と認める異例の発言。Bloomberg・CNN・NBC News・CNBC・Quartz・Deadline等が一斉報道。8月リスクレポートでの壊滅的ミスアラインメントリスク「very low」→「low」引き上げと合わせ、Anthropic内部からのAI安全性懸念が連続的に表面化。

Key Takeaways

  • Jacob Coxonが3年間のOpenAI・Anthropic事前学習研究を経て退職 — 「gambling with our lives」と公開警告
  • X投稿が7,600万閲覧で社会的反響が大きい — WSJ独占インタビューも同日
  • Evan Hubinger(アライメントサイエンスリード)が「超知性のアライメント計画はまだない」と認める異例の発言
  • 8月リスクレポートのミスアラインメントリスク引き上げ(very low→low)と連続する内部懸念の表面化
  • IPOロードショー準備中のタイミングで安全性関連ネガティブニュースが集中

Best Practice Updates

  • AI安全性懸念の高まりはエージェントプロンプトの安全性制約設計(行動範囲制限・人間承認ゲーティング)の重要性をさらに裏付け
  • CLAUDE.mdへの行動範囲制限・出力制約の明示的記述がより一層重要に

Same Day Signals

すべて見る →

元記事の著作権は各著作者に帰属します。