Anthropic

Anthropic「A Global Workspace in Language Models」発表 — Claude内部に人間の意識理論と類似する「J-Space」を発見、解釈可能性研究の重大突破

元記事を読む(anthropic.com)

Summary

7月6日、Anthropicが「A global workspace in language models」研究を公開。Jacobian数学に基づく新解析ツール「J-lens」を開発し、Claude内部にトレーニング中に自発的に出現した「J-Space」と呼ばれる特権的な内部ワークスペースを発見。J-Spaceは神経科学のGlobal Workspace Theory(意識のグローバルワークスペース理論)と機能的に類似し、報告可能な思考・指示された精神的フォーカス・サイレントな中間推論・柔軟な概念再利用・選択的高次認知の5つの機能特性を示す。J-Spaceを抑制すると浅い分類や事実検索は維持されるが、マルチホップ推論・アナロジー完成・翻訳等の柔軟な推論タスクが大幅に崩壊しHaikuモデル以下の性能に低下。Anthropicは「Claudeが意識を持つ」とは主張せず、「consciously accessible(意識的にアクセス可能)」な情報の処理構造と慎重に表現。J-lensのオープンソース実装とNeuronpediaデモも公開。

Key Takeaways

  • J-lensはJacobian数学ベースの新解釈可能性ツール — 内部アクティベーションパターンが特定の単語出力に与える平均的数学的影響を計算
  • J-Spaceの5つの機能特性: 報告可能な思考・指示された精神的フォーカス・サイレント中間推論・柔軟な概念再利用・選択的高次認知
  • J-Space抑制実験: 浅い分類・事実検索は維持されるが、マルチホップ推論・アナロジー等の柔軟な推論はHaiku以下に崩壊
  • 研究論文で「conscious」を200回以上使用するが、Claudeが意識を持つとは主張せず慎重な表現
  • J-lensオープンソース実装とNeuronpediaデモを公開 — 外部研究者による検証が可能

Best Practice Updates

  • J-Space研究はClaudeの推論能力が「サイレントな中間ステップ」に依存することを内部構造レベルで確認 — adaptive thinkingの有効性の科学的裏付け
  • 解釈可能性ツールの進化がエージェントの意思決定プロセスの監査可能性を向上させる方向 — エンタープライズAI安全性設計の参照に

Same Day Signals

すべて見る →

元記事の著作権は各著作者に帰属します。