MiniMax H3 発表:新しいマルチモーダル生成モデルが2Kコンテンツ出力と動画編集機能をサポート

MiniMaxは7月31日に新世代のマルチモーダル生成モデルMiniMax H3を発表し、近日中にモデルの重みを公開することを発表しました。過去の画像、動画、音声を専門に扱うモデルとは異なり、H3はマルチモーダルコンテキストの統一理解を強調し、「単一生成タスクの完了」から汎用的なマルチモーダル創作へと移行しようとしています。

MiniMax H3は、テキスト、画像、音声、動画などの多様な入力形式をサポートし、直接2K解像度のコンテンツを出力でき、生成された音画作品は最長15秒に達することができます。ユーザーは異なるタイプの素材を同じコンテキストに配置し、モデルが画面、音、文字、創作要求を統一的に理解することで、一貫したコンテンツ生成や編集を実現します。

MiniMax H3の動画編集機能が強化

MiniMax H3の動画編集は今回のデモの重点機能です。このモデルはV2V Motion Transferをサポートしており、参考動画の中の人物の動作や運動軌跡を別の動画に移転し、主体のイメージや画面スタイルをできるだけ保持します。広告、ブランド、eコマースコンテンツにおいて、H3は指示遵守、文字の表示、およびブランド情報の再現能力を強化し、生成されたコンテンツに頻繁に現れる文字の誤りや識別の変形を減少させます。

MiniMax H3は、Artificial Analysisの音声動画編集ランキングで世界第1位にランクインしています。H3の後続のオープンソース化により、高品質な音画生成および動画編集の利用のハードルがさらに低くなるでしょう。

Nakumura
Nakumura
関連サイト:中文版 / TechRitualThe Base Principle