MiniMaxは最近、多モーダル生成モデルMiniMax H3を正式にオープンソース化しました。同時に、モールスレッドはAIトレーニング推論一体型知能計算カードMTT S5000およびMUSAソフトウェアスタックに基づいて、MiniMax H3の適応と運用を完了したと発表しました。MiniMax H3は、テキスト、画像、動画、音声から構成される多モーダルコンテキストを統一的に理解し、最高2K解像度、最長15秒、ネイティブステレオ音声付きの動画を生成できる汎用全モーダル生成システムです。
今回のオープンソース内容にはモデルの重みが含まれており、ローカルデプロイメントと完全なワークフロー検証ソリューションが提供されています。
MiniMax H3システムは多モーダル生成能力を備えています
アーキテクチャの観点から、H3システムは3つのコアモジュールで構成されています。その中で、H3-Context-IRはユーザーが入力した多モーダル命令を理解し、抽出し、それを構造化されたコンテキスト中間表現に変換する役割を担っており、現在はAPIを通じて提供されています。H3-Baseは中間表現に基づいて768p解像度の音声と映像コンテンツを生成するもので、今回のオープンソースの主要部分です。H3-Regenerate-2Kは768pの結果を元のコンテキストと共にモデルに戻し、2K解像度でより高画質の動画を再生成します。このモジュールはまだオープンソース化されておらず、APIを通じて提供されています。
モデル設計において、H3-Baseは330億パラメータのH3-Omni-Transformerアーキテクチャを採用しており、異なるモーダルエンコーダーを通じてテキスト、画像、動画、音声を統一的にエンコードし、多モーダルシーケンスとして共同予測を行います。その下には、視覚情報と音声情報の圧縮にそれぞれ使用されるH3-VisualVAEとH3-AudioVAEが含まれています。公式はまた、文から動画生成、始まりと終わりのフレーム生成、さらには複数の画像、動画、音声の混合入力などのタスクに向けた2つの主要バージョンを提供しており、人物とシーンの保持、動作や口形の編集などのシナリオに適しています。また、中国語、英語、日本語、韓国語を含む11言語の対話をサポートしています。
開発者はMiniMax H3を利用して多様なアプリケーションを行うことができます
開発者がデプロイを容易にするために、公式は「H3-Baseローカルデプロイ」と「完全2Kワークフロー」の2つの検証パスを提供しており、SGLang、vLLM、diffusers、ComfyUIなどのフレームワークを通じて推論をサポートしています。このモデルは現在、MiniMax H3 Community Licenseに基づいて公開されており、開発者はオープンソースプラットフォームからダウンロードして使用できます。

