Googleは今日、Gemini 3.8 LiveおよびGemini 3.8 Live Extended Thinkingを発表し、これを「最も先進的なリアルタイム対話モデル」と称しました。3月に発表された3.1 Flash Liveに続くこれらの新しいモデルは、AIとの対話をより直感的でインテリジェントにすることを目的としています。名前が示すように、Gemini 3.8 Live Extended Thinkingは「強化されたインテリジェンスと多段階推論」を提供し、最近発表されたGmail Live(対話検索)、Docs Live(ドラフト生成と編集)、およびKeep Live(ノート作成)などの高複雑度のタスクに適しています。
このモデルはGemini Liveでも展開されており、3.8 Live Extended Thinkingは「同時に推論し、物語を語る」ことができます。
このモデルは複雑なワークフローに対して強化されたインテリジェンスを提供し、会話の流れを一貫して保ちながら、初期の口頭プロンプト(例:「ちょっと確認してみます……」)を使用して自然に応答し、リアルタイムの進行状況の説明を通じて、ユーザーが多段階の背景タスクを段階的に完了できるように導きます。ベンチマークテストに関しては、「人工分析による音声対音声の品質指数で、総合ランキング1位(82.6)」;「エージェンシータスクの完了率において、68.6%のスコアでτ-Voiceをリード」;「Sierraのτ-Voice-bankingベンチマークで35.1%のスコア」;「強力な推論能力を持ち、Big Bench Audioで97.7%のスコアを獲得し、他の最先端モデルと比較しても高い競争力を維持しています。」
Gemini 3.8 Liveは強化された対話インテリジェンスを提供
同時に、Gemini 3.8 Liveの基本モデルは「流暢な対話と視覚に基づく対話インテリジェンス」を提供します。このモデルはほぼリアルタイムで「視覚入力」を処理でき、対話が続いている間にバックグラウンドでツールやAPI呼び出しを実行します。ユーザーは、バックグラウンドタスクが完了する間に「リクエストに応答し、対話を続ける」ことが期待できます。さらに、このモデルは対話の中で検出し、97のサポートされている言語間で切り替えることができます。このモデルは「拡張性とコスト効率を考慮して設計されており」、「音声エージェント競技場で第2位」にランクインしています。
Gemini 3.8 LiveはAIモデルのSearch Live体験をサポートします。

