Googleは、複雑な身体動作をテキストに変換する手話翻訳モデルを開発しました。このモデルは、50以上の手話をカバーする100,000時間以上のデータを使用しています。この技術は手話からテキストへの変換(SL2T)と呼ばれ、現在は研究段階から消費者向けデバイスへと移行しており、最初にPixel 11でアメリカ手話(ASL)をサポートしています。このモデルは、GboardとLive Transcribeの新しい手話からテキストへの機能をサポートしています。ユーザーはタイピングすることなく、手話を使ってウェブ検索やメッセージ、文書の作成、またはGoogleのGeminiとのインタラクションを行うことができます。
Live Transcribeでは、ユーザーは会話中に手話で反応することもできます。
音声転写とは異なり、手話翻訳は単に一連の音を単語にマッピングすることはできません。手話は独立した言語であり、独自の文法と語彙を持っています。意味は手の動き、顔の表情、頭の位置、腕や胴体を通じて同時に伝達されることがあります。これにより、手話翻訳はコンピュータビジョンの問題であると同時に、言語翻訳の問題でもあります。GoogleのSL2Tは、署名者の動作を構造化された表現に変換し、それをテキストに翻訳することで、これらの両方の側面を同時に処理するように設計されています。
Googleの手話翻訳モデルはリアルタイム翻訳機能を実現することを目指しています
このシステムは、原始的なカメラ映像を翻訳に送信するのではなく、GoogleのMediaPipe Holisticモデルを利用して署名者の姿勢のランドマークを識別します。これらのランドマークは、手、顔、身体の動きを表す幾何学的座標を含みます。これらの座標のみが翻訳システムに送信され、原始的な映像はすぐに破棄されます。この方法は、敏感な視覚情報の漏洩を減少させることを目的としており、同時にモデルに署名者の手話に関する情報を提供します。SL2Tは、その後、これらのランドマークのシーケンスを直接テキストに翻訳し、通常手話研究で使用される単純化されたラベルで表現される中間の「注釈」に依存しません。
Googleは、これによりモデルが空間関係や非手動信号などの要素をより良く捉えることができると述べています。
このシステムは、50以上の手話において100,000時間のデータで訓練されており、その約4分の1はASLからのデータです。Googleは、異なる言語、方言、熟練度での訓練が、手話間で共有される構造を学ぶのに役立つと述べています。FLEURS-ASLベンチマークテストでは、Googleはゼロショットスコア70 BLEURTを報告しており、この結果は以前の報告よりも大幅に高いものです。同社は、日常使用に影響を与える可能性のある実際の課題に対してもこのモデルをテストしました。
このシステムは、完成した映像を処理するのではなく、リアルタイム翻訳を行うことを目的としています。Googleは、遅延を減少させ、誰かが署名していないときに虚偽の出力が発生するのを避け、左手署名と片手署名のパフォーマンスを改善することを開発に含めています。片手署名は、ユーザーが片手でスマートフォンを持ち、もう一方の手で署名する必要があるため、特に重要です。Googleは、開発プロセス全体で聴覚障害者のユーザーや組織と協力し、テスト、データ収集、評価を行いました。同社は、この技術が聴覚障害者の専門家の意見や聴覚障害者を代表する組織の諮問委員会の指導の下で開発されたと述べています。
初期に導入された機能は、GboardとPixel 11でのASLから英語への翻訳をサポートしており、Googleは今後さらに多くのデバイスと手話を展開する予定です。この作業は最終的には翻訳を超える可能性があり、Googleは手話生成やその他のアプリケーションが今後の方向性になると指摘しています。

