My News ← 戻る

AnthropicがClaudeの隠れた推論空間「J-space」を発見——新解釈ツールJ-lensを開発

AnthropicがClaudeの隠れた推論空間「J-space」を発見——新解釈ツールJ-lensを開発

項目 内容
ジャンル AI
日付 2026-07-10
元記事 MIT Technology Review

要約

Anthropicはメカニスティック解釈可能性研究の一環として、Jacobian lens(J-lens)ツールを開発した。Claude Opus 4.6の内部に「J-space」と呼ばれる隠れた計算領域が存在し、モデルが近い将来に生成する可能性のある語が格納されていることが判明した。さらに、モデルが解決策を持たない問題に対して虚偽の答えを選ぶ際の内部状態のパターンも観察された——つまり「ハルシネーション」の兆候を内部観察できる可能性がある。研究者らはJ-spaceを「頭上の照明ではなく懐中電灯」と評し、LLMの動作理解における限定的な洞察として位置づける。AI安全性・信頼性研究の新たなアプローチとして注目される。


元記事を読む →