MiniMaxは7月31日に新世代のマルチモーダル生成モデルMiniMax H3を発表し、近日中にモデルの重みを公開することを発表しました。過去の画像、動画、音声を専門に扱うモデルとは異なり、H3はマルチモーダルコンテキストの統一理解を強調し、「単一生成タスクの完了」から汎用的なマルチモーダル創作へとシフトしようとしています。
MiniMax H3は、テキスト、画像、音声、動画など多様な入力形式をサポートし、直接2K解像度のコンテンツを出力でき、生成される音画作品は最長15秒に達します。ユーザーは異なるタイプの素材を同じコンテキストに配置し、モデルが画面、音、テキスト、創作要求を統一的に理解することで、一貫したコンテンツ生成または編集を実現します。
MiniMax H3の動画編集機能が強化
MiniMax H3の動画編集は、今回の展示の重点機能です。このモデルはV2V Motion Transferをサポートしており、ある参考動画の人物の動作や運動軌跡を別の動画に移転し、主体のイメージと画面スタイルをできるだけ保持します。広告、ブランド、eコマースコンテンツに対して、H3は指示遵守、テキストの表示、ブランド情報の再現能力を強化し、生成コンテンツにしばしば見られるテキストの誤りやロゴの変形を減少させます。
MiniMax H3は、Artificial Analysisの音声動画編集ランキングで世界第1位に位置しています。H3の後続のオープンソース化により、高品質な音画生成と動画編集の使用のハードルがさらに低くなるでしょう。

