AI News HubLIVE
站內改寫2 分鐘閱讀

MiniMax釋出MiniMax H3:全能模態影片模型,可生成帶原生立體聲的15秒2K片段

MiniMax 釋出通用多模態生成模型 MiniMax H3,可基於文本、影像、影片和音訊參考生成 4–15 秒、帶原生立體聲的 2K 影片。模型已透過 API 和 Hailuo AI 應用提供,開源權重尚未釋出。早期評測顯示其在影片編輯任務中領先。

來源MarkTechPost作者: Asif Razzaq

MiniMax 於 2026 年 7 月 31 日正式釋出 MiniMax H3,並將其定位為通用多模態生成模型,而非附加了多種能力的文生影片模型。MiniMax H3 將文本、影像、影片和音訊作為統一上下文讀取,並輸出帶有原生立體聲的影片。基礎規格為 2K 解析度、4 至 15 秒時長,且時長僅支援整數秒。

MiniMax 表示,過去的影片生成鏈路往往會將文生影片、圖生影片、首尾幀、主體參考、運動參考和影片編輯拆分成多個專家模型。H3 將這些任務整合進同一種預訓練正規化,引用關係和編輯關係都透過自然語言表達。例如,使用者可以用類似“參考影片 1 的鏡頭運動,讓圖 2 中的角色演唱,並使歌聲與音訊 3 匹配”的提示詞來描述需求。

在部署方面,H3 目前只能透過 API 使用,官方尚未提供可在自有硬體上執行的開源權重。模型地址為 MiniMax-H3,同時已上線消費端 Hailuo AI。MiniMax 將 H3 的目標行業定為廣告、品牌、電商、產品設計、UI/UX、遊戲、電影預覽和零售目錄媒體,應用場景涵蓋廣告變體生成、商品與 listing 影片、動態海報、片頭序列、網站主視覺迴圈、角色一致的遊戲過場動畫以及影片到影片的動作遷移。

API 提供文生影片、首尾幀圖生影片和參考生成三種入口,統一走非同步三步流程:建立任務、輪詢 task_id、下載 content.url。使用限制包括:參考影像最多 9 張;參考影片最多 3 段、每段 2 至 15 秒且總時長不超過 15 秒;參考音訊最多 3 段,且傳送音訊時必須附帶影像或影片。混合輸入總計不超過 12 個檔案;提示詞不超過 7000 字元;請求體不超過 64MB,官方建議大檔案使用 URL。單檔案大小限制為影片 50MB、影像 30MB、音訊 15MB;支援 H.264/H.265、JPG/PNG/WEBP/HEIC/HEIF、WAV/MP3 格式。

技術層面,H3 的四個關鍵元件包括:重構後的上下文 Omni 表示,讓字幕描述“上下文與目標影片之間的關係”而非僅描述目標,多數素材約 10 萬 token 的推理量被蒸餾到平均約 4K token;H3-VAE 分詞器大幅提升壓縮比,帶來約 4 倍的有效序列長度增益,從而降低訓練和推理成本,也是原生 2K 的基礎;H3-Omni Transformer 棄用了 Hailuo-02 架構,針對多模態上下文導致序列長度方差增大的問題,將理解與生成負載分離並分別調優硬體利用率,端到端訓練吞吐量提升近 30%;上下文重生(In-Context Regeneration)則取代了外掛式超分模組,由基礎模型在原始多模態上下文中重新生成低解析度輸出,從而恢復超分模型難以準確補全的小字與細節。

價格與排名方面,MiniMax 聲稱 H3 在 2K 下的每秒價格不到主流模型的三分之一,在 768p 下不到主流 720p 模型的一半。第三方追蹤與釋出報道將 2K 按量計費價格列為每秒 0.13 美元,約合 15 秒片段 1.95 美元;不過截至發稿,MiniMax 的按量計費頁面仍只列出 Hailuo 2.3 檔位,因此該數字應視為轉引而非官方一手資訊。另據 SCMP 引述 Artificial Analysis 的資料,H3 在影片編輯中領先,但在文生影片上落後於 Google 的 Gemini Omni Flash,在圖生影片上落後於 Seedance 2.0 和 Gemini Omni Flash。

MiniMax 還承諾“未來幾天”開源權重,但尚未提供具體時間,目前 API 是唯一使用途徑。H3-VAE 的 4 倍有效序列長度增益使原生 2K 在經濟上可行,上下文重生機制則有助於保留品牌文字等細節。