VideoReTalking:音声で野外トーキングヘッド動画の口形同期編集を実現

現実の環境で撮影されたトーキングヘッドの動画があり、セリフを置き換えたいが、口の動きが全く合わないと想像してみてください。従来のツールは、複雑な照明や頭の姿勢の変化の下で失敗することが多く、結果が不自然になってしまいます。VideoReTalkingは、この痛点を解決するために特化したオープンソースツールで、SIGGRAPH Asia 2022で発表され、野外(in the wild)動画に対して音声ベースの口の同期技術を提供します。このGitHubプロジェクトは、動画編集者、コンテンツクリエイター、研究者を対象にしており、彼らが現実の動画のトーキングヘッドを簡単に編集できるようにし、自然な口の動きと顔の詳細を保ちながら、スタジオレベルの環境に依存しないようにしています。

自動で顔を検出・追跡し、野外動画の変化に適応

VideoReTalkingの最も強力な部分は、その顔強化モジュールです。入力された動画の中で、自動的に話者の顔を識別し、正確に追跡することができます。動画に照明の変化、頭の回転、背景の干渉があっても、ツールは明確な顔のマスクを生成し、後続の口の同期が口の領域にのみ影響を与えることを保証します。このステップは、AIを使って全体をスキャンし、ターゲットとなる顔をロックオンし、余分な干渉を避けるというもので、野外撮影の生の素材を扱いやすくします。

従来の方法と比べて、ここでのアプローチは特に時間的整合性(temporal consistency)に重点を置いています。連続したフレームを分析し、異なるカット間で口の動きが突然跳ねるのを防ぎ、リアルな会話の流暢さを模倣します。YouTubeクリエイターや短編動画の編集者にとって、この機能は、スマートフォンで撮影した動画を直接使用し、プロフェッショナルなトーキングヘッドの効果を迅速に生成できることを意味します。

GitHub - OpenTalker/video-retalking: [SIGGRAPH Asia 2022] VideoReTalking: Audio-based Lip Synchronization for Talking Head Video Editing In the Wild · GitHub 介面截圖
GitHub – OpenTalker/video-retalking: [SIGGRAPH Asia 2022] VideoReTalking: Audio-based Lip Synchronization for Talking Head Video Editing In the Wild · GitHub公式ページのスクリーンショット

音声駆動で正確な口の動きを生成し、元のセリフを自然に置き換え

コアプロセスの中で、VideoReTalkingは新しい録音音声を直接口の動き生成に駆動します。ツールはまず、入力動画の音声特徴を抽出し、その後、事前訓練されたモデルを通じて対応する口の動きのシーケンスを生成し、元の口の動作を置き換えます。このaudio-to-lipプロセスは、完璧に整列されたスタジオの照明や固定された姿勢に依存しないため、野外環境に特に適しています。出力結果は、元の顔のテクスチャや表情を保持します。

興味深いことに、彼らは目や歯の詳細も微調整し、明るすぎる歯や不自然な瞬きなど、一般的なディープフェイクの欠陥を避けます。リポジトリを開くと、ユーザーは簡単なPythonコマンドを使用して実行し、動画と音声ファイルを入力するだけで、自動的に編集後のバージョンを出力できます。教育用動画やポッドキャストを動画に変換するユーザーにとって、このワンステップの同期は、ポストプロダクションの時間を大幅に短縮します。

ワンクリックで完結するプロセス、入力から出力まで手動調整不要

全体のパイプラインは非常にシンプルに設計されています:まずソース動画とドライビングオーディオを入力し、ツールは順次、顔の強化、口の同期、エンハンサーのステップを実行し、最終的に完全な動画を合成します。GitHubリポジトリは、事前訓練されたモデルのダウンロードリンクを提供しており、ユーザーはクローン後、いくつかのコマンドを実行するだけでローカルで動作させることができ、追加の訓練は不要です。このエンドツーエンドの設計により、非専門の開発者でも簡単に扱えるようになっています。

さらに、プロジェクトは拡張性を強調しており、解像度や処理時間などのカスタムパラメータをサポートしており、さまざまなハードウェア構成に適しています。他の口の同期ツールと比較して、VideoReTalkingは野外動画においてより優れた安定性を示し、特に横顔や動的なカメラショットを処理する際にはアーティファクトがほとんど発生しません。研究者はリポジトリをフォークして、特定の言語やシーンにモデルをさらにファインチューニングすることができます。

オープンソースリソースが豊富で、Starsの累積がコミュニティの関心を反映

GitHub上で、VideoReTalkingは完全なコード、モデルの重み、デモ動画を提供しており、ユーザーはすぐに効果をテストできます。ナビゲーションメニューには保存された検索やフォルダが含まれており、更新を追跡しやすくなっています。最新のコミットや履歴は活発なメンテナンスを示しています。明確な価格設定はありませんが、オープンソースプロジェクトとして無料で利用可能で、ライセンスや行動規範が適切な使用を保証します。Starsの数やトピックのタグは、AI動画編集コミュニティの関心を反映しており、リソースセクションには論文のリンクもあり、さらに深く理解できます。

製品名:VideoReTalking
公式ウェブサイト:https://github.com/OpenTalker/video-retalking

Nakumura
Nakumura
関連サイト:中文版 / TechRitualThe Base Principle