米グーグル(Google)は、極めて低い遅延で自然な双方向音声会話を実現する特化型モデル「Gemini 3.8 Live」および推論深度を拡張した「Gemini 3.8 Live Extended Thinking」を正式公開しました。
従来の音声AIでは難しかった「人間による会話途中の自然な割り込み(バージイン)」に柔軟に対応し、話者の言語変化をミリ秒単位で自動検知して97言語以上をシームレスに切り替える先進的な音声対話基盤です。
上位版となるExtended Thinkingモデルでは、ユーザーが指定した推論深度に応じて論理的な思考ステップを展開し、裏側で複雑なマルチステップタスクを処理しながら、その進捗や判断理由をリアルタイムに対話音声で分かりやすく解説します。
さらに、画面やカメラ映像を共有しながら音声で指示を出せるリアルタイム・ビジュアルグラウンディングも統合されており、スマートフォンのカメラ越しの物理世界やPC画面の作業をAIが視覚的に理解しながら会話を継続できます。
本モデル群は、Gemini API、Google AI Studio、Google Workspace、およびGeminiモバイルアプリを通じて即時利用可能となっており、企業のカスタマーサポート自動化や現場オペレーター向け音声アシスタントの構築を強力に加速させる決定打として注目を集めています(一次ソース:Google公式発表はこちら / Google for Developers公式ドキュメント)。
