OpenAI、AI対話の遅延問題を解決するGPT-Live音声インタラクションシステムを発表

OpenAI は、AI 音声アシスタントの会話の途切れや応答の切り替えの不自然さといった核心的な課題を解決するために、全面的に再構築された音声インタラクションシステム GPT-Live を正式に発表しました。このシステムの技術的な詳細は、エンジニアの Justin Uberti と Zahan Malkani によって、6 ヶ月にわたる基盤構造の改造を含む技術ブログで詳しく説明されています。OpenAI の従来の AI 音声インタラクションはターン制モデルを採用しており、「ターン検出器」に依存してユーザーが発言を終了するタイミングを判断しています。

しかし、このメカニズムには明らかな欠陥があります。早すぎる検出はユーザーの発言を中断し、遅すぎる検出は不自然な沈黙を生じさせます。

GPT-Live はこのアプローチを完全に排除し、全二重構造を採用しています。これにより、ユーザーの音声を受信しながら同時に応答を生成することが可能になります。システムは毎秒何度も自律的に判断を行い、聞くべきか、発言すべきか、一時停止すべきか、ユーザーに中断を許可すべきかを決定します。スムーズな会話を実現するために、OpenAI はシステムを二つの独立したレイヤーに分割しました。音声ストリームは、ユーザーのデバイスと GPT-Live モデルの間で専用の低遅延高速チャネルを通じて伝送され、ネットワーク検索、コード実行、GPT-5.5 などの最先端モデルを呼び出しての深層推論などの重負荷タスクは、非同期のバックグラウンドパスで処理されます。

これは、複雑なクエリに追加の数秒の処理が必要な場合でも、音声レイヤーが自然な会話を維持でき、フレーム落ちやカクつき、接続のフリーズが発生しないことを意味します。

OpenAI が GPT-Live を通じて音声インタラクション体験を改善

伝送層の最適化において、OpenAI は従来の Python asyncio コードを Go 言語に置き換え、1.5 億人以上の週次アクティブユーザーに対してより安定したフレーム伝送を実現しました。接続確立の遅延に対して、チームは WARP(WebRTC Abridged Roundtrip Protocol)というオープン規範を開発し、Instant Connect 機能と組み合わせることで、従来の WebRTC が必要とする六回のネットワーク往復の起動プロセスを単一のデータパケットに圧縮し、ユーザーがほぼ瞬時にリアルタイム音声会話を開始できるようにしました。

GPT-Live の導入は、AI 音声インタラクションが「トランシーバーモード」から自然な人間と機械の対話への飛躍を示しています。即時音声と重い計算タスクを分離することにより、OpenAI が構築した音声インターフェースは、体験的に人間同士のコミュニケーションにより近づき、大規模商用音声 AI サービスの新しい技術基準を確立しました。

Nakumura
Nakumura
関連サイト:中文版 / TechRitualThe Base Principle