小米、工業用音声認識大モデル「Xiaomi-CocktailASR-1」を発表

小米は、工業用の音声認識大モデル Xiaomi-CocktailASR-1 を正式に発表し、オープンソース化しました。このニュースは9月11日に発表されました。小米の公式技術微博によると、このモデルは複数の人が同時に話す複雑な音声シーンに特化しており、音声認識における「カクテルパーティー」問題、つまり騒がしい環境の中で複数の話者から特定のターゲットユーザーの音声内容を識別し、転写することを重点的に解決します。

小米によると、Xiaomi-CocktailASR-1 はエンドツーエンドの LLM アーキテクチャを採用しており、ターゲット話者の一部の参照音声を声紋のヒントとして利用します。複数の話者が重なって話す状況でも、ターゲット話者の内容を抽出し、転写することができます。公式は、このモデルが大規模な多話者データで訓練されており、AliMeeting、AMI、LibriMix などの主要な多話者テストセットで最良の性能を達成していると指摘しています。

Xiaomi-CocktailASR-1 は多話者音声認識能力を備えています

さらに、単一話者シーンでの認識性能も主流の単人 ASR モデルと同等であり、同じモデルで単人と多人数のシーンを両立させることができ、異なる音声認識モデル間で切り替える必要がありません。また、このモデルは負のサンプル拒否能力も備えており、音声中にターゲット話者が存在しない場合、モデルは空のテキストを出力し、非ターゲット音声による誤認識や誤トリガーのリスクを低減します。

小米はまた、Xiaomi-CocktailASR-1 が思考連鎖推論モードをサポートしており、認識結果に対して説明可能な推論プロセスを提供できることを述べています。現在、Xiaomi-CocktailASR-1 のモデルウェイトと推論コードはすでにオープンソース化されています。

Nakumura
Nakumura
関連サイト:中文版 / TechRitualThe Base Principle