OpenAIは、AI音声アシスタントの長年の課題である会話の中断やターンの切り替えのぎこちなさを解決することを目的とした、全面的に再構築された音声インタラクションシステム「GPT-Live」を正式に発表しました。このシステムの基盤となるアーキテクチャの改造は、同社のエンジニアであるJustin UbertiとZahan Malkaniによって、技術ブログで詳細に公開されました。OpenAIの従来のAI音声インタラクションはターン制のモデルを採用しており、「ターン検出器」に依存してユーザーが発言を終了するタイミングを判断しています。
しかし、このメカニズムには明らかな欠陥があります。早すぎる検出はユーザーの発言を中断させ、遅すぎる検出は不自然な沈黙を生じさせます。
GPT-Liveはこのアプローチを完全に排除し、全二重アーキテクチャを採用しています。これにより、ユーザーの音声を受信しながら同時に応答を生成することが可能です。システムは毎秒何度も自律的に判断を行い、聞くべきか、発言すべきか、一時停止すべきか、またはユーザーに中断を許可するべきかを決定します。スムーズな会話を実現するために、OpenAIはシステムを2つの独立したレイヤーに分割しました。音声データは専用の低遅延高速チャネルを介してユーザーのデバイスとGPT-Liveモデルの間で伝送され、ネットワーク検索、コード実行、GPT-5.5などの先端モデルを呼び出しての深層推論などの重い処理は非同期のバックグラウンドパスで完了します。
これは、複雑なクエリが追加の数秒の処理を必要とする場合でも、音声レイヤーが自然な会話を維持し、フレーム落ち、カクつき、または接続の凍結が発生しないことを意味します。
OpenAIはGPT-Liveを通じて音声インタラクション体験を改善
伝送レイヤーの最適化に関して、OpenAIは従来のPython asyncioコードをGo言語に置き換え、1.5億以上の週活性ユーザーに対してより安定したフレーム伝送を実現しました。接続確立の遅延に対処するため、チームは「WARP(WebRTC Abridged Roundtrip Protocol)」と呼ばれるオープン規格を開発し、Instant Connect機能と組み合わせることで、従来のWebRTCが必要とする6回のネットワーク往復の起動プロセスを1つのデータパケットに圧縮し、ユーザーがほぼ瞬時にリアルタイム音声会話を開始できるようにしました。
GPT-Liveの導入は、AI音声インタラクションが「トランシーバーモード」から自然な人間と機械の対話への飛躍を示しています。即時音声と重い計算タスクを分離することで、OpenAIが構築した音声インターフェースは、人間同士のコミュニケーションにより近い体験を提供し、大規模商用音声AIサービスの新しい技術基準を確立しました。

