AI News HubLIVE
站内改写2 分钟阅读

MiniMax发布MiniMax H3:全能模态视频模型,可生成带原生立体声的15秒2K片段

MiniMax 发布通用多模态生成模型 MiniMax H3,可基于文本、图像、视频和音频参考生成 4–15 秒、带原生立体声的 2K 视频。模型已通过 API 和 Hailuo AI 应用提供,开源权重尚未发布。早期评测显示其在视频编辑任务中领先。

来源MarkTechPost作者: Asif Razzaq

MiniMax 于 2026 年 7 月 31 日正式发布 MiniMax H3,并将其定位为通用多模态生成模型,而非附加了多种能力的文生视频模型。MiniMax H3 将文本、图像、视频和音频作为统一上下文读取,并输出带有原生立体声的视频。基础规格为 2K 分辨率、4 至 15 秒时长,且时长仅支持整数秒。

MiniMax 表示,过去的视频生成链路往往会将文生视频、图生视频、首尾帧、主体参考、运动参考和视频编辑拆分成多个专家模型。H3 将这些任务整合进同一种预训练范式,引用关系和编辑关系都通过自然语言表达。例如,用户可以用类似“参考视频 1 的镜头运动,让图 2 中的角色演唱,并使歌声与音频 3 匹配”的提示词来描述需求。

在部署方面,H3 目前只能通过 API 使用,官方尚未提供可在自有硬件上运行的开源权重。模型地址为 MiniMax-H3,同时已上线消费端 Hailuo AI。MiniMax 将 H3 的目标行业定为广告、品牌、电商、产品设计、UI/UX、游戏、电影预览和零售目录媒体,应用场景涵盖广告变体生成、商品与 listing 视频、动态海报、片头序列、网站主视觉循环、角色一致的游戏过场动画以及视频到视频的动作迁移。

API 提供文生视频、首尾帧图生视频和参考生成三种入口,统一走异步三步流程:创建任务、轮询 task_id、下载 content.url。使用限制包括:参考图像最多 9 张;参考视频最多 3 段、每段 2 至 15 秒且总时长不超过 15 秒;参考音频最多 3 段,且发送音频时必须附带图像或视频。混合输入总计不超过 12 个文件;提示词不超过 7000 字符;请求体不超过 64MB,官方建议大文件使用 URL。单文件大小限制为视频 50MB、图像 30MB、音频 15MB;支持 H.264/H.265、JPG/PNG/WEBP/HEIC/HEIF、WAV/MP3 格式。

技术层面,H3 的四个关键组件包括:重构后的上下文 Omni 表示,让字幕描述“上下文与目标视频之间的关系”而非仅描述目标,多数素材约 10 万 token 的推理量被蒸馏到平均约 4K token;H3-VAE 分词器大幅提升压缩比,带来约 4 倍的有效序列长度增益,从而降低训练和推理成本,也是原生 2K 的基础;H3-Omni Transformer 弃用了 Hailuo-02 架构,针对多模态上下文导致序列长度方差增大的问题,将理解与生成负载分离并分别调优硬件利用率,端到端训练吞吐量提升近 30%;上下文重生(In-Context Regeneration)则取代了外挂式超分模块,由基础模型在原始多模态上下文中重新生成低分辨率输出,从而恢复超分模型难以准确补全的小字与细节。

价格与排名方面,MiniMax 声称 H3 在 2K 下的每秒价格不到主流模型的三分之一,在 768p 下不到主流 720p 模型的一半。第三方追踪与发布报道将 2K 按量计费价格列为每秒 0.13 美元,约合 15 秒片段 1.95 美元;不过截至发稿,MiniMax 的按量计费页面仍只列出 Hailuo 2.3 档位,因此该数字应视为转引而非官方一手信息。另据 SCMP 引述 Artificial Analysis 的数据,H3 在视频编辑中领先,但在文生视频上落后于 Google 的 Gemini Omni Flash,在图生视频上落后于 Seedance 2.0 和 Gemini Omni Flash。

MiniMax 还承诺“未来几天”开源权重,但尚未提供具体时间,目前 API 是唯一使用途径。H3-VAE 的 4 倍有效序列长度增益使原生 2K 在经济上可行,上下文重生机制则有助于保留品牌文字等细节。