macOS向けGeminiが高度な音声制御機能を搭載、スマートなディクテーションと文脈理解を実現

2026年5月のI/OカンファレンスでプレビューされたmacOSのGeminiが、現在、先進的な音声制御機能を展開し始めました。Googleは、この機能によりユーザーが「デスクトップ上の任意のウィンドウで自然に話す」ことができると主張しており、主に2つの重要な特徴をカバーしています。まずはスマートディクテーションで、「口語を明確で簡潔なテキストに変換」し、「ああ」や「うーん」といった音声フィラーを自動的に除去し、ユーザーが文中で行った修正を考慮します。フォーマットされたテキストは現在のカーソル位置に入力され、これは今後登場予定のGemini Intelligence内のGboard Ramblerの音声からテキストへの体験に似たものを提供するはずです。

2つ目の機能は単なるディクテーションを超え、現在の画面のコンテキストを理解して複雑なタスクを実行します。これはオプション機能で、ユーザーは設定でGeminiの推論機能を有効にできます。

Geminiの音声制御機能がユーザー体験を根本的に変える

ユーザーは情報を抽出し要約できます:デスクトップ上でローカルファイル、画像、または文書をハイライトし、Geminiに具体的な要求を伝えます。例えば、「これらの獣医の書類を読んで、犬舎に私の犬の医療歴を電子メールで要約して」と言うことができます。テキストを整理し書き直す:画面上の任意の場所でテキストをハイライトし、音声を使って即座に書き直し、トーンを調整し、洗練されたバージョンを必要な場所に直接配置します。「これらのノートをエグゼクティブサマリーに変換し、上部にTL;DRを付けて」と言ってみることができます。画像を生成し編集する:音声を使って視覚効果を作成し、アイデアを構想したり旅行の計画を強化したり、デスクトップ上でデザインリクエストを参照して迅速に更新することができます。

「このイラストをダークモードバージョンに生成して」と言うことができます。

Fnキーを長押しすることでmacOSの任意の場所で有効にするか、「Geminiに尋ねる」プロンプトボックスの末尾にある新しい画面共有ボタンをクリックします。Gemini for macOSを最新バージョン(1.88)に更新していることを確認してください。この新しい音声機能は、全世界のすべての英語ユーザーに展開され、他の言語も「近日中に登場予定」です。

Nakumura
Nakumura
関連サイト:中文版 / TechRitualThe Base Principle