Metaは、初のリアルタイム音声認識モデル「Muse Voice Transcribe」を正式に発表し、複数言語のストリーミング転写機能をMeta AI for Mac、Muse Code、およびMeta Model APIを通じて開発者に提供します。Muse Voice Transcribeは、Macプラットフォームに全システムレベルの音声入力サポートを提供します。
Muse Voice Transcribeはストリーミング認識と話者分離技術を統合
Meta Superintelligence Labsによると、Muse Voice Transcribeはストリーミング自動音声認識(ASR)、話者の日誌化(speaker diarization)、およびエンドポイント検出(endpointing)を単一のモデルに統合しています。実際のアプリケーションでは、システムは話し手が話している間にリアルタイムでテキストを生成し、録音内で20人以上の話者を区別し、個々の文がいつ終了するかを判断します。このプロセスには追加のポストプロセッシングは必要ありません。
このモデルは70以上の言語データでトレーニングされており、リリース時には25の言語が検証済みです。1時間を超える音声をサポートし、同じ文内または文間でのネイティブレベルのコードスイッチング(code-switching)が可能です。さらに、モデルは言語、キーワード、およびコンテキストバイアス(biasing)機能をサポートし、認識精度を向上させます。Metaは固定の速度と精度のトレードオフ設定を採用せず、モデルが各出力テキストの前に聴く音声の長さを自動的に決定します。このメカニズムは「適応遅延」(adaptive delay)と呼ばれています。
システムは、処理が容易な文を迅速に出力し、難しい語彙に直面した場合は、より長い音声コンテキストを参照して精度を向上させます。
価格とランキングパフォーマンス
Metaは、9月1日現在、Muse Voice TranscribeがArtificial Analysisのストリーミング音声転写ランキングで1位にランクインしていることを指摘しました。Muse Voice Transcribeは本日よりMeta Model APIを通じて提供され、価格は1,000分の音声あたり¥480(US$3)、すなわち1時間あたり¥30(US$0.18)です。
このモデルは、Meta AI for MacおよびMuse Code内の音声入力機能も同時にサポートしています。
Macプラットフォームでは、ユーザーはFnキーを押し続けることで、任意のアプリケーション内で音声入力を行うことができます。Metaは最近、Meta AIの< a href="https://www.techritual.com/2026/09/01/578134/">Appleプラットフォームへのサポートを拡大しており、限定的なCarPlay統合や、Mac向けに特別に設計されたMeta AIとMuse Codeアプリケーションを提供しています。
| 項目 | 規格 |
|---|---|
| サポート言語数 | 70以上(トレーニングデータ)/25(リリース時検証) |
| 話者分離上限 | 20人以上 |
| 音声長さサポート | 1時間を超える |
| コードスイッチング | 文内および文間のネイティブ切り替えをサポート |
| バイアス機能 | 言語、キーワード、コンテキストバイアス |
| 遅延メカニズム | 適応遅延(adaptive delay) |
| API価格 | ¥480(US$3)/ 1,000分 |
| 1時間あたりのコスト | ¥30(US$0.18) |
| Mac起動ショートカットキー | Fnキーを押し続ける |

