摩爾線程基於 MTT S5000 完成 MiniMax H3 模型適配並開源多模態生成系統

MiniMax 近日正式開源了多模態生成模型 MiniMax H3。與此同時,摩爾線程宣佈已基於 AI 訓練推理一體智算卡 MTT S5000 及 MUSA 軟件棧,完成對 MiniMax H3 的適配與運行。MiniMax H3 是一套通用型全模態生成系統,能夠統一理解文本、圖像、視頻和音頻構成的多模態上下文,並生成最高 2K 解像度、最長 15 秒、帶有原生立體聲音頻的視頻。

此次開源內容包括模型權重,同時提供本地部署和完整工作流程驗證方案。

MiniMax H3 系統具備多模態生成能力

從架構來看,H3 系統由三個核心模塊組成。其中,H3-Context-IR 負責理解並提煉用户輸入的多模態指令,將其轉換為結構化的上下文中間表示,目前通過 API 提供;H3-Base 根據中間表示生成 768p 解像度的音視頻內容,是此次開源的主要部分;H3-Regenerate-2K 則將 768p 結果與原始上下文一同送回模型,以 2K 解像度重新生成更高畫質視頻,該模塊尚未開源,也通過 API 提供。

在模型設計上,H3-Base 採用 330 億參數的 H3-Omni-Transformer 架構,通過不同模態編碼器將文本、圖像、視頻和音頻統一編碼為多模態序列後進行聯合預測。其下包含 H3-VisualVAE 和 H3-AudioVAE,分別用於視覺和音頻信息壓縮。官方同時提供兩個主要版本,分別面向文生視頻、首尾幀生視頻,以及多圖像、多視頻、多音頻混合輸入等任務,適用於人物與場景保留、動作和嘴型編輯等場景,並支持包括中文、英語、日語、韓語在內的 11 種語言對話。

開發者可利用 MiniMax H3 進行多種應用

為方便開發者部署,官方給出「H3-Base 本地部署」和「完整 2K 工作流程」兩條驗證路徑,支持通過 SGLang、vLLM、diffusers、ComfyUI 等框架進行推理。該模型目前基於 MiniMax H3 Community License 發布,開發者可通過開源平台下載使用。

想睇更深入嘅 AI 模型與工程科技報道?
前往 The Base Principle 繁體中文 AI 新聞 →
Henderson
Henderson

Henderson 是 TechRitual Hong Kong 科技編輯,專注報導智能手機、消費電子產品、SIM 卡及流動通訊市場。自加入 TechRitual 以來,累計撰寫數千篇科技報導及產品評測,內容同步發佈至 SINA 及 Yahoo Tech 等主要平台。

友情網站:日本語版 / TechNipponThe Base Principle(AI・工程)