Google DeepMind、Gemma 4 12B 公開——エンコーダフリーの統合マルチモーダルモデル
Google DeepMind、Gemma 4 12B 公開——エンコーダフリーの統合マルチモーダルモデル
| 項目 | 内容 |
|---|---|
| ジャンル | AI |
| 日付 | 2026-06-10 |
| 元記事 | Google DeepMind |
要約
Google DeepMindがオープンソースモデル「Gemma 4 12B」を公開した。最大の特徴は従来のビジョンエンコーダを排除した「エンコーダフリー」設計で、テキスト・画像・動画を単一の統合アーキテクチャで処理する。視覚入力を直接トークン列として扱うことでモデル構成が大幅に簡素化され、デプロイの容易性と推論コスト削減が期待できる。12Bのパラメータ規模はエッジデバイスや低リソース環境での実行にも適しており、オープンソースコミュニティへの提供により研究・応用の多様化が見込まれる。エンコーダフリーなマルチモーダル設計が将来のAIアーキテクチャのトレンドとなる可能性を示す重要なモデルリリースである。