在文本大模型領域持續發力之後,人工智能企業 MiniMax 於近日正式推出了全新的全模態生成模型MiniMax H3,並向行業承諾將在幾天內全面開源模型權重。

作爲一款支持多模態上下文輸入的生成模型,MiniMax H3能夠同時接收文本、圖像、視頻以及聲音的任意組合作爲輸入,並最終輸出帶有原生雙聲道音頻的高清視頻。在實際應用中,用戶只需向模型提供參考視頻、圖片或音頻素材,並結合自然語言指令,即可一氣呵成完成複雜的視聽內容創作。

image.png

在技術架構上,MiniMax H3徹底打破了傳統多模態模型按任務拆分專家模型的做法。研發團隊將文生圖、文生視頻、圖到視頻以及音頻處理等多種任務全部整合進同一個預訓練框架中,推出了更簡潔的 H3-Omni Transformer 架構,使端到端訓練吞吐量提升了近30%。同時,通過重寫 Tokenizer 帶來的 H3-VAE 架構,實現了極高的壓縮率,有效降低了高分辨率下的推理成本。

在定價與生態方面,MiniMax H3在2K 分辨率下的每秒價格不到主流同類模型的三分之一,同時在設計初期便充分考慮了對國產芯片的兼容性。目前,該模型在電影片頭、遊戲 UI 動畫、動態海報以及廣告電商等場景中展現出廣闊的應用潛力,其對文字渲染和品牌信息呈現的準確度也得到了顯著提升。