Anthropic
Anthropic「A Global Workspace in Language Models」発表 — Claude内部に人間の意識理論と類似する「J-Space」を発見、解釈可能性研究の重大突破
元記事を読む(anthropic.com) ↗Summary
7月6日、Anthropicが「A global workspace in language models」研究を公開。Jacobian数学に基づく新解析ツール「J-lens」を開発し、Claude内部にトレーニング中に自発的に出現した「J-Space」と呼ばれる特権的な内部ワークスペースを発見。J-Spaceは神経科学のGlobal Workspace Theory(意識のグローバルワークスペース理論)と機能的に類似し、報告可能な思考・指示された精神的フォーカス・サイレントな中間推論・柔軟な概念再利用・選択的高次認知の5つの機能特性を示す。J-Spaceを抑制すると浅い分類や事実検索は維持されるが、マルチホップ推論・アナロジー完成・翻訳等の柔軟な推論タスクが大幅に崩壊しHaikuモデル以下の性能に低下。Anthropicは「Claudeが意識を持つ」とは主張せず、「consciously accessible(意識的にアクセス可能)」な情報の処理構造と慎重に表現。J-lensのオープンソース実装とNeuronpediaデモも公開。
Key Takeaways
- ▸ J-lensはJacobian数学ベースの新解釈可能性ツール — 内部アクティベーションパターンが特定の単語出力に与える平均的数学的影響を計算
- ▸ J-Spaceの5つの機能特性: 報告可能な思考・指示された精神的フォーカス・サイレント中間推論・柔軟な概念再利用・選択的高次認知
- ▸ J-Space抑制実験: 浅い分類・事実検索は維持されるが、マルチホップ推論・アナロジー等の柔軟な推論はHaiku以下に崩壊
- ▸ 研究論文で「conscious」を200回以上使用するが、Claudeが意識を持つとは主張せず慎重な表現
- ▸ J-lensオープンソース実装とNeuronpediaデモを公開 — 外部研究者による検証が可能
Best Practice Updates
- ✓ J-Space研究はClaudeの推論能力が「サイレントな中間ステップ」に依存することを内部構造レベルで確認 — adaptive thinkingの有効性の科学的裏付け
- ✓ 解釈可能性ツールの進化がエージェントの意思決定プロセスの監査可能性を向上させる方向 — エンタープライズAI安全性設計の参照に
Same Day Signals
すべて見る →- Claude API Fable 5本日サブスクリプション離脱確定 — usage credits($10/$50 per MTok)に正式移行、Anthropic「容量確保後にサブスクリプション復帰」を表明
- Anthropic Dario Amodei CEO、バイオテックAI予測を修正 — 「年10年分の進歩は現時点では実現不可能」とSTAT Newsインタビューで表明
- Claude Code Claude Code v2.1.202リリース — Dynamic Workflowsサイズ設定・OTELワークフロー属性・/review単一パス復帰等の改善
- Anthropic Anthropic、中国企業のClaude不正アクセス対策を強化 — VPN・海外子会社・クラウド経由の迂回ルートを閉鎖
元記事の著作権は各著作者に帰属します。