AI News HubLIVE
站内改写2 分钟阅读

MiniMax 发布 M3 模型:采用 MSA 架构,支持 100 万 Token 上下文、原生多模态与智能编程

MiniMax 于 2026 年 6 月 1 日正式发布 M3 模型,引入 MiniMax 稀疏注意力(MSA)架构,支持 100 万 Token 上下文窗口、原生图像/视频输入及桌面操作,API 已上线。

来源MarkTechPost作者: Asif Razzaq

MiniMax 于 2026 年 6 月 1 日正式发布 MiniMax M3 模型。该模型采用全新的 MSA(MiniMax 稀疏注意力)架构,支持 100 万 Token 的上下文窗口,并原生支持图像、视频输入以及桌面电脑操作。API 已上线,可通过 MiniMax Code、MiniMax Token Plan 和 MiniMax API 使用。

M3 是 M2.7 之后的下一代模型。MiniMax 将其定位为首个将前沿编码性能、100 万 Token 上下文窗口与原生多模态输入结合于单一架构的开源权重模型。模型权重和技术报告将在发布后 10 天内公开。

MSA 架构 MSA 通过“KV 外部聚合 Q”的方式,将 KV 缓存分块,每个块只读取一次,内存访问连续。相比全注意力机制,在 100 万 Token 上下文下,每个 Token 的计算量仅为上一代 M2 模型的 1/20,预填充阶段速度提升 9 倍以上,解码阶段速度提升 15 倍以上。与 Flash-Sparse-Attention 等开源实现相比,速度提升超过 4 倍。

编码与智能基准 MiniMax 报告了以下基准测试结果:SWE-Bench Pro 得分 59.0%,超越 GPT-5.5 和 Gemini 3.1 Pro,接近 Opus 4.7;Terminal-Bench 2.1 得分 66.0%;SWE-fficiency 得分 34.8%;KernelBench Hard 得分 28.8%;MCP Atlas 得分 74.2%;Claw-Eval 在评估模型中得分最高;SVG-Bench 超越 Opus 4.7;OmniDocBench 得分高于 Gemini 3.1 Pro;OSWorld-Verified 计算机使用任务完成率达 70.06%。

MiniMax 还构建了交互式用户模拟框架,用于多轮开发者协作训练和评估。

原生多模态 M3 从训练的第一步起就进行混合模态训练,文本、图像和视频同时训练。MiniMax 报告称,交错数据(文本与图像自然混合)对模型性能的影响比通常认为的更关键。训练数据规模达到约 100 万亿 Token。

实际任务示例

  • 论文复现:M3 自主运行近 12 小时,复现了 ICLR 2025 最佳论文实验,产生 18 次提交和 23 张实验图。
  • CUDA 内核优化:M3 在约 24 小时内优化了 FP8 GEMM 内核,将 Hopper FP8 峰值利用率从 7.6% 提升至 71.3%(9.4 倍加速)。
  • PostTrainBench:M3 在 12 小时内自主完成数据合成、训练、评估和迭代,得分为 0.37。

MiniMax Code MiniMax Code 是基于 M3 构建的智能代理产品,支持多智能体团队、生产者+验证者循环和计算机使用。

API 与定价 M3 API 已在 platform.minimax.io 上线。输入长度不超过 512K Token 时按标准费率计费,超过 512K 则按长上下文费率计费。提供思考模式切换。Token Plan 套餐从每月 20 美元(约 17 亿 Token)起。