8月3日、MiniMaxはその最初のマルチモーダル生成モデル「MiniMax H3」を正式にオープンソース化しました。発表当日、モールス・スレッドはAIトレーニングと推論を統合したスマートコンピューティングカード「MTT S5000」とMUSAソフトウェアスタックを活用し、このモデルの高速な適合および効率的な実行を迅速に完了しました。
MiniMaxがマルチモーダル分野で新たに打ち出したH3は、従来の単一タスクの境界を打破し、多様な文脈の中で創作意図を正確に理解し、テキスト、画像、音声、ビデオの総合入力を全面的にサポートしています。公式によると、このモデルは2K解像度、最大15秒のネイティブな音声映像コンテンツを直接出力でき、性能と実用性において商用用途に適した多様なシナリオでの生成能力を持っています。
注目すべきは、H3がArtificial Analysisビデオモデルランキングで「ビデオ編集能力世界一」の成績を収めたことです。2K解像度のビデオ生成価格は1秒あたりわずか0.8元で、非常に高い商業的なコストパフォーマンスを持っています。また、オープンソースの特性により、応用のハードルが大幅に低下しており、企業がローカルに柔軟に配置し、独自のデータをカスタマイズできるだけでなく、セキュリティと合規性の要件にも効果的に対応できます。これにより、マルチモーダル生産性の広範な普及を加速します。
モデルの新たなリリースに対し、モールス・スレッドチームは非常に高い反応効率を示しました。モデルがオープンソース化された当日、研究開発チームはモデル構造の分解、コア技術の分析、典型的な演算子の整理を行い、わずか3時間でSGLang-MUSA推論フレームワークからMATE、muDNN高性能演算子ライブラリへの完全な適合経路を確立し、H3をMTT S5000上で迅速かつ安定して展開することができました。
モールス・スレッドは、今後もMiniMaxと協力関係を深め、マルチモーダル分野でより強力な文脈理解能力とより大きなモデル規模を共同で探求し、AGI技術のイノベーションと産業化の実現を全面的に加速させていくと述べました。
