Google DeepMind、音声認識AI「Gemini 3.5 Transcribe」を発表
Google DeepMind、音声認識AI「Gemini 3.5 Transcribe」を発表
| 項目 | 内容 |
|---|---|
| ジャンル | AI |
| 日付 | 2026-08-27 |
| 元記事 | Google DeepMind Blog |
要約
Google DeepMindは、従来の音声認識(STT)を超えた「インテリジェント文字起こし」機能を持つ「Gemini 3.5 Transcribe」を発表した。単純な音声テキスト変換に留まらず、話者の意図・文脈・感情を理解した上で文章を構造化する能力を持つ。会議議事録の自動作成や医療記録のリアルタイム文字起こしなど、業務用途での活用が見込まれる。Geminiファミリーの一員として既存のGemini APIからアクセス可能であり、多言語対応も含む。競合するOpenAI Whisperや専用STTサービスとの差別化ポイントは、Geminiの大規模言語モデルと統合された意味理解能力にある。