摩尔スレッド、MTT S5000を基にMiniMax H3モデルの適応を完了し、多モーダル生成システムをオープンソース化

MiniMaxは最近、マルチモーダル生成モデルMiniMax H3を正式にオープンソース化しました。同時に、モールスレッドはAIトレーニング推論一体型知能計算カードMTT S5000およびMUSAソフトウェアスタックに基づいて、MiniMax H3の適応と運用を完了したと発表しました。MiniMax H3は、テキスト、画像、動画、音声から構成されるマルチモーダルコンテキストを統一的に理解し、最高2K解像度、最長15秒、ネイティブステレオ音声付きの動画を生成できる汎用全モーダル生成システムです。

今回のオープンソース内容にはモデルの重みが含まれており、ローカルデプロイメントと完全なワークフロー検証ソリューションが提供されています。

MiniMax H3システムはマルチモーダル生成能力を備えています

アーキテクチャの観点から見ると、H3システムは3つのコアモジュールで構成されています。その中で、H3-Context-IRはユーザーの入力したマルチモーダル命令を理解し、抽出して構造化されたコンテキスト中間表現に変換する役割を担っており、現在APIを通じて提供されています。H3-Baseは中間表現に基づいて768p解像度の音声・映像コンテンツを生成するもので、今回のオープンソースの主要部分です。H3-Regenerate-2Kは768pの結果を元のコンテキストと共にモデルに戻し、2K解像度でより高品質な動画を再生成します。このモジュールはまだオープンソース化されておらず、APIを通じて提供されています。

モデル設計において、H3-Baseは330億パラメータのH3-Omni-Transformerアーキテクチャを採用しており、異なるモーダルエンコーダーを通じてテキスト、画像、動画、音声を統一的にエンコードし、マルチモーダルシーケンスとして結合予測を行います。その下にはH3-VisualVAEとH3-AudioVAEが含まれ、それぞれ視覚情報と音声情報の圧縮に使用されます。公式は、文から動画を生成するタスク、先頭と末尾のフレームから動画を生成するタスク、複数の画像、動画、音声の混合入力などに対応する2つの主要なバージョンを提供しており、人物とシーンの保持、動作と口形の編集などのシナリオに適用可能で、中国語、英語、日本語、韓国語を含む11言語の対話をサポートしています。

開発者はMiniMax H3を利用して多様なアプリケーションを構築できます

開発者がデプロイしやすいように、公式は「H3-Baseローカルデプロイメント」と「完全な2Kワークフロー」の2つの検証パスを提供しており、SGLang、vLLM、diffusers、ComfyUIなどのフレームワークを通じて推論をサポートしています。このモデルは現在、MiniMax H3 Community Licenseに基づいて公開されており、開発者はオープンプラットフォームを通じてダウンロードして使用できます。

Nakumura
Nakumura
関連サイト:中文版 / TechRitualThe Base Principle