AI News HubLIVE
站內改寫2 分鐘閱讀

MiniMax發佈MiniMax H3:全能模態視頻模型,可生成帶原生立體聲的15秒2K片段

MiniMax 發佈通用多模態生成模型 MiniMax H3,可基於文本、圖像、視頻和音頻參考生成 4–15 秒、帶原生立體聲的 2K 視頻。模型已通過 API 和 Hailuo AI 應用提供,開源權重尚未發佈。早期評測顯示其在視頻編輯任務中領先。

來源MarkTechPost作者: Asif Razzaq

MiniMax 於 2026 年 7 月 31 日正式發佈 MiniMax H3,並將其定位為通用多模態生成模型,而非附加了多種能力的文生視頻模型。MiniMax H3 將文本、圖像、視頻和音頻作為統一上下文讀取,並輸出帶有原生立體聲的視頻。基礎規格為 2K 分辨率、4 至 15 秒時長,且時長僅支持整數秒。

MiniMax 表示,過去的視頻生成鏈路往往會將文生視頻、圖生視頻、首尾幀、主體參考、運動參考和視頻編輯拆分成多個專家模型。H3 將這些任務整合進同一種預訓練範式,引用關係和編輯關係都通過自然語言表達。例如,用户可以用類似“參考視頻 1 的鏡頭運動,讓圖 2 中的角色演唱,並使歌聲與音頻 3 匹配”的提示詞來描述需求。

在部署方面,H3 目前只能通過 API 使用,官方尚未提供可在自有硬件上運行的開源權重。模型地址為 MiniMax-H3,同時已上線消費端 Hailuo AI。MiniMax 將 H3 的目標行業定為廣告、品牌、電商、產品設計、UI/UX、遊戲、電影預覽和零售目錄媒體,應用場景涵蓋廣告變體生成、商品與 listing 視頻、動態海報、片頭序列、網站主視覺循環、角色一致的遊戲過場動畫以及視頻到視頻的動作遷移。

API 提供文生視頻、首尾幀圖生視頻和參考生成三種入口,統一走異步三步流程:創建任務、輪詢 task_id、下載 content.url。使用限制包括:參考圖像最多 9 張;參考視頻最多 3 段、每段 2 至 15 秒且總時長不超過 15 秒;參考音頻最多 3 段,且發送音頻時必須附帶圖像或視頻。混合輸入總計不超過 12 個文件;提示詞不超過 7000 字符;請求體不超過 64MB,官方建議大文件使用 URL。單文件大小限制為視頻 50MB、圖像 30MB、音頻 15MB;支持 H.264/H.265、JPG/PNG/WEBP/HEIC/HEIF、WAV/MP3 格式。

技術層面,H3 的四個關鍵組件包括:重構後的上下文 Omni 表示,讓字幕描述“上下文與目標視頻之間的關係”而非僅描述目標,多數素材約 10 萬 token 的推理量被蒸餾到平均約 4K token;H3-VAE 分詞器大幅提升壓縮比,帶來約 4 倍的有效序列長度增益,從而降低訓練和推理成本,也是原生 2K 的基礎;H3-Omni Transformer 棄用了 Hailuo-02 架構,針對多模態上下文導致序列長度方差增大的問題,將理解與生成負載分離並分別調優硬件利用率,端到端訓練吞吐量提升近 30%;上下文重生(In-Context Regeneration)則取代了外掛式超分模塊,由基礎模型在原始多模態上下文中重新生成低分辨率輸出,從而恢復超分模型難以準確補全的小字與細節。

價格與排名方面,MiniMax 聲稱 H3 在 2K 下的每秒價格不到主流模型的三分之一,在 768p 下不到主流 720p 模型的一半。第三方追蹤與發佈報道將 2K 按量計費價格列為每秒 0.13 美元,約合 15 秒片段 1.95 美元;不過截至發稿,MiniMax 的按量計費頁面仍只列出 Hailuo 2.3 檔位,因此該數字應視為轉引而非官方一手信息。另據 SCMP 引述 Artificial Analysis 的數據,H3 在視頻編輯中領先,但在文生視頻上落後於 Google 的 Gemini Omni Flash,在圖生視頻上落後於 Seedance 2.0 和 Gemini Omni Flash。

MiniMax 還承諾“未來幾天”開源權重,但尚未提供具體時間,目前 API 是唯一使用途徑。H3-VAE 的 4 倍有效序列長度增益使原生 2K 在經濟上可行,上下文重生機制則有助於保留品牌文字等細節。