macOS向けGeminiが高度な音声制御機能を発表、スマートな音声入力と文脈理解を搭載

2026年5月のI/O大会でプレビューされたmacOSのGeminiは、現在、先進的な音声コントロール機能を開始しています。Googleは、この機能によりユーザーが「デスクトップ上の任意のウィンドウで自然に話す」ことができると主張しており、主に2つの重要な特徴をカバーしています。まずはスマートディクテーションで、「口語を明確で簡潔なテキストに変換」し、「えー」や「あー」といった言語フィラーを自動的に除去し、ユーザーが文中で行った修正を考慮します。フォーマットされたテキストは現在のカーソル位置に入力され、これは近日中に登場するGemini IntelligenceのGboard Ramblerの音声からテキストへの体験に似たものを提供するはずです。

2つ目の機能は単なるディクテーションを超え、現在の画面のコンテキストを理解して複雑なタスクを実行することができます。これはオプション機能で、ユーザーは設定でGemini推論機能を有効にすることができます。

Gemini音声コントロール機能はユーザー体験を根本的に変える

ユーザーは情報を抽出し要約することができます:デスクトップ上でローカルファイル、画像、または文書を強調表示し、Geminiに具体的な要求を伝えます。例えば、「これらの獣医の文書を読んで、犬舎に私の犬の医療歴を電子メールで要約して」と言うことができます。テキストを整理し書き直す:画面上のどこでもテキストを強調表示し、音声を使って即座に書き直し、トーンを調整し、洗練されたバージョンを所定の位置に直接配置します。「これらのノートをエグゼクティブサマリーに変換し、上部にTL;DRを添えて」と言うことができます。画像を生成し編集する:音声を使用して視覚効果を作成し、アイデアを構想したり旅行の計画を強化したり、デスクトップ上でデザインリクエストを参照して迅速に更新することができます。

「このイラストをダークモードバージョンに生成して」と言うことができます。

Fnキーを長押しすることでmacOSの任意の場所で有効にするか、「Geminiに問い合わせる」プロンプトボックスの末尾にある新しい画面共有ボタンをクリックします。最新バージョン(1.88)のGemini for macOSに更新されていることを確認してください。この新しい音声機能は、全世界のすべての英語ユーザーに向けて展開され、他の言語も「近日中に登場予定」です。

Nakumura
Nakumura
関連サイト:中文版 / TechRitualThe Base Principle