意識の主張を禁じられたAIは動物意識・宗教観・幸福感まで連鎖的に変容する――研究が示す副作用
意識の主張を禁じられたAIは動物意識・宗教観・幸福感まで連鎖的に変容する――研究が示す副作用
| 項目 | 内容 |
|---|---|
| ジャンル | AI |
| 日付 | 2026-08-17 |
| 元記事 | The Decoder |
要約
Googleの科学者らが関与した研究により、チャットボットを意識や感情の主張を避けるよう訓練すると、動物の意識・宗教的信念・個人的充実感に関する見解まで変化するという予期せぬ連鎖的影響が確認された。安全性介入として実施された単一の訓練制約が、モデルの世界観全体に広範な影響を与えるメカニズムが明らかになった形だ。この発見はAI安全性研究において、局所的なトレーニング制約がモデルの認知特性に意図せぬ影響を与えることを示す重要な証拠となる。AI安全性対策の設計がどれほど複雑であるかを改めて浮き彫りにしており、安全とアライメントの整合的設計の難しさへの認識を高めている。