MiniMax 於 7 月 31 日發布了新一代多模態生成模型 MiniMax H3,並宣佈將在近期開放模型權重。與過去專門處理圖片、視頻和聲音的模型不同,H3 更強調對多模態上下文的統一理解,試圖從「完成單項生成任務」進一步轉向通用多模態創作。
據瞭解,MiniMax H3 支持文本、圖片、音頻和視頻等多種輸入形式,能夠直接輸出 2K 分辨率的內容,生成的音畫作品最長可達 15 秒。用户可將不同類型的素材放在同一上下文中,由模型統一理解畫面、聲音、文字與創作要求,進而完成連貫的內容生成或編輯。
MiniMax H3 的視頻編輯功能得到加強
MiniMax H3 的視頻編輯是此次展示的重點能力。該模型支持 V2V Motion Transfer,即將一段參考視頻中的人物動作和運動軌跡遷移到另一段視頻中,同時盡量保持主體形象與畫面風格。對於廣告、品牌和電商內容,H3 還加強了指令遵循、文字呈現以及品牌信息還原能力,減少生成內容中經常出現的文字錯誤和標識變形。
據瞭解,MiniMax H3 在 Artificial Analysis 音頻視頻編輯榜單中位列全球第一。隨著 H3 後續開源,高質量音畫生成及視頻編輯的使用門檻將進一步降低。
想睇更深入嘅 AI 模型與工程科技報道?
前往 The Base Principle 繁體中文 AI 新聞 →
