SadTalker:単一画像からリアルな3D音声アバターを生成

静止した人物の写真が1枚しかないと想像してみてください。それに音声を合わせて自動的に話させ、自然な表情やリアルな頭の動きを実現することができるのです。複雑な3Dモデリングや多角度撮影は必要ありません。この課題は、短編動画制作、バーチャルアナウンサー、ソーシャルメディアコンテンツ制作において非常に一般的で、特に独立したクリエイターにとっては、専門的なツールのコストが高く、敷居が高いです。SadTalkerは、CVPR 2023の論文プロジェクトで、単一画像による音声駆動の話す顔のアニメーション問題を解決するために特化しています。AIを使用してリアルな3D運動係数を学習し、スタイライズされたが高度にリアルなアニメーションを生成します。開発者、研究者、コンテンツクリエイターが迅速に取り組むことができます。

クロスプラットフォームのインストールサポート Linux Unix Windows macOS Docker

SadTalkerのインストールの柔軟性は、最大の売りの一つです。どのシステムを使用していても、簡単にデプロイできます。Linux / Unix環境では、直接condaで環境を作成し、pip installで依存関係をインストールするだけで、数コマンドで完了します。Windowsユーザーには専用のスクリプトがあり、CPUとGPUモードをサポートし、一般的なCUDAの互換性の問題を回避します。macOSユーザーも同様に簡単で、M1 / M2チップもサポートされており、追加の調整は不要です。コンテナ化を好む方には、Dockerイメージをワンクリックで取得でき、WSLなどの仮想環境もカバーされており、開発プロセスがスムーズに進行します。

GitHub - OpenTalker/SadTalker: [CVPR 2023] SadTalker:Learning Realistic 3D Motion Coefficients for Stylized Audio-Driven Single Image Talking Face Animation · GitHub 介面截圖
GitHub – OpenTalker/SadTalker: [CVPR 2023] SadTalker:Learning Realistic 3D Motion Coefficients for Stylized Audio-Driven Single Image Talking Face Animation · GitHub公式ページのスクリーンショット

事前トレーニングモデルで単一画像音声生成プロセスを加速

SadTalkerリポジトリを開いて、事前トレーニングモデルをダウンロードすることが第一歩です。これらはすでに大量のデータでトレーニングされており、直接推論に使用することで開発時間を大幅に短縮します。コアは3D運動係数の学習で、単一の入力画像と音声ファイルから始まり、モデルは自動的に頭部の姿勢、表情係数、まばたきを推定し、高品質な話すアニメーション動画を出力します。従来の2D手法と比べて、この3D指向のアプローチは、より自然な深さの動きを捉えます。例えば、顎がわずかに上がったり、眉が上がったりする動きです。特にカートゥーンやアートポートレートのようなスタイライズされたアプリケーションに適しています。推論速度も速く、GPU上では数秒で短編動画が生成され、CPUモードでも許容範囲です。

実際の操作では、ユーザーは正面の顔写真とWAV音声を準備し、inferenceコマンドを実行するだけで、モデルが自動的に顔を整列させ、アニメーションを駆動します。GFPGANのオフラインパッチがさらに画像品質を向上させ、低解像度の入力のぼやけやアーティファクトを修正し、出力をよりリアルな動画に近づけます。この設計により、非専門的なユーザーでもデモを簡単に生成でき、GitHub上のサンプル動画では、同期率が95%以上に達し、口形が音声に非常に正確に一致しています。

履歴バージョン追跡で開発と貢献の反復が容易

SadTalkerリポジトリの履歴記録とドキュメントナビゲーションにより、開発者は最新のコミットやブランチの変化を簡単に追跡できます。初版からCVPR 2023のリリースまで、各更新には詳細な変更ログが付いており、例えば運動係数の予測精度が最適化されたり、スタイライズモードがアートフィルターをサポートするようになったりしています。フォルダ構造は明確で、デモ、configs、チェックポイントが含まれており、ユーザーはフォークした後に迅速に修正できます。例えば、音声の前処理をカスタマイズしたり、Webアプリに統合したりできます。この点は、基盤に基づいてさらなる実験を行いたい研究者に特に役立ちます。

全体的に見て、SadTalkerは単なるツールではなく、オープンソースコミュニティのベンチマークでもあり、ユーザーが新しいモデルやプラットフォームのサポートを貢献することを奨励しています。商業ソフトウェアと比較して、その無料でオープンな性質は、参入障壁を大幅に低下させており、すでに多くのフォーク版が多言語音声やリアルタイムアプリケーションに拡張されています。audio-driven animationを探求したいユーザーにとって、このプロジェクトはローカルデプロイからクラウドDockerまでの完全な出発点を提供しています。

製品名:SadTalker
公式サイト:https://github.com/Winfredy/SadTalker
サポートプラットフォーム:Linux / Unix / Windows / macOS / Docker, WSLなど

Nakumura
Nakumura
関連サイト:中文版 / TechRitualThe Base Principle