Google、Gemini 3.5の音声文字変換モデルを発表

Google は公式に Gemini 3.5 Transcribe を発表しました。これは最新の音声からテキストへのモデルで、正確でインテリジェントなリアルタイム転写機能を提供することを目的としています。このモデルは従来の音声認識モデルとは異なり、背景雑音、専門用語、音声の流暢さの問題を効果的に処理し、元の音声を正確かつフォーマットされたテキストに直接変換します。

Gemini 3.5 Transcribe のコア機能

Google の紹介によれば、Gemini 3.5 Transcribe はユーザーの自然言語スタイルを捉え、意図をより良く理解し、カスタム語彙を識別することで、音声によるタスクの実行能力を実現します。このモデルは多くの先進的な機能を提供しており、以下のようなものがあります:

“インテリジェント転写:自己修正をシームレスに処理し、フィラーを除去し、テキストを自動フォーマットします。”

Google

さらに、Gemini 3.5 Transcribe は多言語認識をサポートし、85 以上の言語を自動検出して転写でき、最大 3 人の話者の音声を正確に識別し、事前録音された音声にタイムスタンプを提供します。

開発者と企業の応用可能性

このモデルは Google AI Studio の Gemini API と Gemini Enterprise Agent Platform を通じてアクセスでき、開発者がワークフローにシームレスに統合できるようになっています。Google はまた、このモデルがリアルタイムストリーミングと事前録音音声処理のために2つの異なる API サービスを提供していることを指摘しています。それぞれは:

“リアルタイムストリーミング:1 秒未満の遅延で連続的な双方向ストリーミングを提供し、インタラクティブな音声アプリケーションに適しています。”

Google

“事前録音音声処理:録音された音声、会議、通話記録などを転写し、話者の帰属と逐語的タイムスタンプを提供します。”

Google

これにより、開発者は音声エージェント、リアルタイム字幕ツール、または通話後分析パイプラインを簡単に構築し、ユーザー体験を向上させることができます。

Gemini 3.5 Transcribe の性能向上

Gemini 3.5 Transcribe は、以前のモデルである Chirp 3 に比べて性能が大幅に向上しており、人工分析によると、ストリーミングモードでの平均単語誤り率(WER)は 4.0%、非ストリーミングモードでは 2.6% です。このモデルは騒がしい現実の環境でも優れた性能を発揮し、郵便番号や注文 ID などのアルファベット数字エンティティを正確に捉えます。

“FLEURS ベンチマークテストでは、このモデルは多くの言語と地域で Chirp 3 を上回る性能を示し、ストリーミングモードでの WER は 5.50%、非ストリーミングモードでは 5.04% でした。”

Google

これらの改善により、Gemini 3.5 Transcribe は開発者や企業にとって音声転写分野での強力なツールとなっています。

資料出典:Google 公式発表

Nakumura
Nakumura
関連サイト:中文版 / TechRitualThe Base Principle