2026 年 6 月 1 日,国产大模型公司 MiniMax 在上海正式发布新一代旗舰通用模型 MiniMax M3。在启动科创板 IPO 辅导的背景下,M3 的发布不仅是技术层面的升级,更承载着市场对这家公司长期技术路线的期待。
M3 最大的亮点在于:它同时将「前沿编程能力」「1M 超长上下文」和「原生多模态」三条技术路线压在同一款模型上。MiniMax 称,M3 是目前开源模型中唯一能做到这三点的。
MSA 稀疏注意力:长上下文的底层突破
长上下文处理的核心难题在于计算复杂度随序列长度呈平方级增长。M3 采用了自研的 MiniMax Sparse Attention(MSA) 稀疏注意力架构来破解这一难题。
MSA 采用两阶段设计:首先使用轻量级的索引 query 对 KV 块进行 Block Max Pool,筛选出 Top-k 的高相关性块;然后对筛选出的结果进行完整的稀疏注意力计算。相比其他稀疏方案(如 DSA、MoBA),MSA 能更精确地为 KV 分块,实现更高的有效上下文覆盖率。
在算子优化层面,MSA 采用 KV outer gather Q 方式,以 KV 块为外层聚合命中 query,每块只读一次、访存连续。实际测试中,MSA 比开源方案(Flash-Sparse-Attention、FlashMoBA)快 4 倍以上;在 1M 上下文下,每 token 计算量仅为上代模型的 1/20,Prefilling 阶段提速超过 9 倍,Decoding 阶段提速超过 15 倍。
让模型自己学会编程
M3 编程能力的核心训练思路不是"喂更多代码",而是构建了一个交互式用户模拟器框架,模拟真实开发者的协作行为——提需求、给反馈、改需求——让模型在与模拟器的交互中学习真实的编程协作场景。
这一训练思路的效果在模型的实际表现中得到了验证。
M3 能够自主完成 FP8 矩阵乘优化——从 baseline 到生产级 kernel,在约 24 小时内完成全部优化工作,将 Hopper FP8 硬件峰值利用率从 7.6% 提升至 71.3%,实现了 9.4 倍的加速。全程自主完成 147 次 benchmark 提交和 1959 次工具调用,没有任何人工介入。
更令人印象深刻的是,M3 自主运行接近 12 小时,成功复现了一篇 ICLR 2025 获奖论文的核心实验。过程包括看懂论文中的图表和公式、编写实现代码、执行实验、诊断错误并调整策略——这本质上是人类研究者的工作方式。
在基准测试方面,M3 在 SWE-Bench Pro 上的得分超过了 GPT-5.5 和 Gemini 3.1 Pro,接近 Claude Opus 4.7;在面向自主 Agent 的端到端评测 Claw-Eval 上拿到了最高分;在评测模型"教练"能力的 PostTrainBench 上,M3 得分 0.37,略低于 Claude Opus 4.7(0.42)和 GPT-5.5(0.39),但明显领先其他模型。
原生多模态:从预训练第一步开始
M3 的多模态能力并非后期"嫁接",而是从预训练的第一步就开始进行图文混合训练,让不同模态数据的语义空间在同一框架下融合。MiniMax 团队发现,interleaved data(文本和图像在序列中交替排列的数据)对模型性能提升至关重要。
为此,团队重构了数据管线,使训练数据的 Token 规模达到 100 万亿量级。M3 还支持原生 1M token 的超长上下文窗口——在复现论文的场景中,模型能够一次性将论文全文、代码仓库、实验日志等大量信息塞入窗口进行处理,无需分块检索。
开源与竞争格局
MiniMax 表示,M3 的技术报告和开源模型权重将在发布后 10 天内更新。这一策略与 Meta 的 Llama 系列相似——通过开源吸引社区开发者和构建生态。M3 的直接对标对象包括 GPT-5.5、Gemini 3.1 Pro 和 Claude Opus 4.7,在多个基准测试中已经展现出接近或超越这些顶级模型的能力。
从 M3 的能力布局来看,Agent 是它的核心定位。编程自主能力(复现论文、优化 kernel)、超长上下文(同时处理论文+代码+日志)、原生多模态(图文交融理解)——这三大能力恰好对应了 Agent 在真实场景中的核心需求:自主执行、全面感知、多模态理解。M3 的发布意味着国产大模型在 Agent 赛道上的竞争,已经从"能不能用"进入到"好不好用"的新阶段。