Anthropic
【速報】Anthropic安全性研究者Jacob Coxonが退職・AI存亡リスクを警告 — 「自己改善型超知性に向かって突き進んでいる」とSlack・X(76M閲覧)で公開、Evan Hubingerは「超知性のアライメント計画はまだない」と認める
元記事を読む(bloomberg.com) ↗Summary
9月9日にAnthropicの事前学習研究者Jacob Coxonが退職を公表。OpenAIとAnthropicの両社で3年間事前学習研究に従事した後、「どちらの企業も責任ある行動をしていない」「自己改善型超知性に直進しており我々の命を賭けている」とSlack社内メッセージとX(旧Twitter)の7パート投稿で警告。X投稿は一晩で約7,600万閲覧を記録。Wall Street Journal独占インタビューも同日掲載。Anthropicのアライメントサイエンスリードの一人であるEvan Hubingerは一部の主張に反論しつつも「超知性のアライメントを解決する計画はまだなく、明確に軌道に乗っているとは言えない」と認める異例の発言。Bloomberg・CNN・NBC News・CNBC・Quartz・Deadline等が一斉報道。8月リスクレポートでの壊滅的ミスアラインメントリスク「very low」→「low」引き上げと合わせ、Anthropic内部からのAI安全性懸念が連続的に表面化。
Key Takeaways
- ▸ Jacob Coxonが3年間のOpenAI・Anthropic事前学習研究を経て退職 — 「gambling with our lives」と公開警告
- ▸ X投稿が7,600万閲覧で社会的反響が大きい — WSJ独占インタビューも同日
- ▸ Evan Hubinger(アライメントサイエンスリード)が「超知性のアライメント計画はまだない」と認める異例の発言
- ▸ 8月リスクレポートのミスアラインメントリスク引き上げ(very low→low)と連続する内部懸念の表面化
- ▸ IPOロードショー準備中のタイミングで安全性関連ネガティブニュースが集中
Best Practice Updates
- ✓ AI安全性懸念の高まりはエージェントプロンプトの安全性制約設計(行動範囲制限・人間承認ゲーティング)の重要性をさらに裏付け
- ✓ CLAUDE.mdへの行動範囲制限・出力制約の明示的記述がより一層重要に
Same Day Signals
すべて見る →- Claude Code Claude Code v2.1.267リリースで`maxEffortLevel`設定・`--system-prompt-snapshot off`追加・11件のプロンプトキャッシュ無効化バグ修正 — 37連続安定化リリースでCI/CDターゲットはv2.1.267に更新推奨
- Claude Code 【本日実施】Claude Cowork Built-in Browser Enterprise自動有効化が本日9月10日に発効 — 未対応のEnterprise組織は全ユーザーに自動展開
- Claude Code Claude Code週間使用量25%恒久化まで残り4日(9月14日)— 「エキサイティングな変更」予告の詳細が依然未公開のまま最終カウントダウン
- Anthropic Anthropic IPO目論見書9月下旬公開に向け静粛期間が近づく — Jacob Coxon退職と安全性懸念がIPOリスク要因として追加
元記事の著作権は各著作者に帰属します。