Google DeepMindは、極めて低遅延なリアルタイム音声対話を実現するフロンティア級マルチモーダルモデル「Gemini 3.8 Live」、および高度な推論層を備えた「Gemini 3.8 Live Extended Thinking」を正式公開しました。
本モデルは、従来の音声対話AIの課題であった「思考のための沈黙」を解消し、ユーザーとの自然な相槌や途中経過の報告を行いながら、背後で非同期に複雑な推論やAPIツール呼び出しを実行できる点が最大の特徴です。
97言語の音声を自動識別してシームレスに切り替える能力に加え、スマートフォンのカメラやPCの画面共有を通じたリアルタイム視覚認識にもネイティブ対応しています。
独立系AI評価機関Artificial AnalysisのSpeech-to-Speech品質指標において、音声の自然さや文脈理解力で世界1位を獲得しました。
Google AI StudioおよびGemini APIを通じて開発者向けに提供が開始されており、カスタマーサポートや遠隔保守作業を担う次世代の自律音声エージェント基盤として期待が高まっています(一次ソース:Google DeepMind公式発表)。
