Anthropic「A Global Workspace in Language Models」発表 — Claude内部に人間の意識理論と類似する「J-Space」を発見、解釈可能性研究の重大突破
7月6日、Anthropicが「A global workspace in language models」研究を公開。Jacobian数学に基づく新解析ツール「J-lens」を開発し、Claude内部にトレーニング中に自発的に出現した「J-Space」と呼ばれる特権的な内部ワークスペースを発見。J-Spaceは神経科学のGlobal Workspace Theory(意識のグローバルワークスペース理論)と機能的に類似し、報告可能な思考・指示された精神的フォーカス・サイレントな中間推論・柔軟な概念再利用・選択的高次認知の5つの機能特性を示す。J-Spaceを抑制すると浅い分類や事実検索は維持されるが、マルチホップ推論・アナロジー完成・翻訳等の柔軟な推論タスクが大幅に崩壊しHaikuモデル以下の性能に低下。Anthropicは「Claudeが意識を持つ」とは主張せず、「consciously accessible(意識的にアクセス可能)」な情報の処理構造と慎重に表現。J-lensのオープンソース実装とNeuronpediaデモも公開。