Google DeepMind、ビデオ生成モデルがコンピュータービジョンの「世界モデル」を既に内包していると主張
Google DeepMind、ビデオ生成モデルがコンピュータービジョンの「世界モデル」を既に内包していると主張
| 項目 | 内容 |
|---|---|
| ジャンル | AI |
| 日付 | 2026-07-20 |
| 元記事 | The Decoder |
要約
Google DeepMindが発表したGenCeptionは、ビデオ生成モデルを深度推定・セグメンテーションなどのコンピュータービジョンタスクに転用するフレームワークだ。合成ビデオのみで学習しながら、既存の最先端システムと同等の性能を達成している。コンピュータービジョン研究では長年「世界モデル」の欠如が課題とされてきたが、ビデオ生成のために訓練されたモデルがその役割を果たし得ることを示している。生成AIとして開発されたモデルが知覚・認識タスクにも活用できるという知見は、AIシステムの汎用性設計や今後のモデル訓練方針に大きな影響を与える可能性がある。