2026年6月的国产大模型赛道,正在经历一场安静而深刻的技术跃迁。
6月12日,MiniMax(稀宇科技)正式开源了月初发布的 M3 旗舰模型权重,同步发布了 MSA(MiniMax Sparse Attention)技术论文。这不是一次常规的开源动作——当业界还在消化"编程评测超越 GPT-5.5"这一消息时,开源生态的快速落地已经开始产生实际影响:摩尔线程 MTT S5000 国产 GPU 在发布当天即完成 Day-0 适配,国产算力与国产大模型的协同正从"各自为战"走向"无缝连接"。
M3 是 MiniMax 的原生多模态旗舰模型,总参数 428B,激活参数 23B。它采用自研 MSA 稀疏注意力架构,是第一个从 Step 0 开始做多模态混合训练的开源大模型,也是目前国内唯一同时具备前沿 Coding & Agentic 能力、1M 超长上下文与原生多模态的开源模型。在权威编程评测 SWE-Bench Pro 中,M3 获得了 59.0 分,超越了 GPT-5.5 和 Gemini 3.1 Pro,逼近全球闭源顶尖水平。
一、MSA 稀疏注意力:一次架构级的效率革命
M3 最值得关注的技术创新,是其自研的 MSA(MiniMax Sparse Attention)稀疏注意力机制。在大模型领域,"稀疏注意力"并非新鲜概念——但 MSA 的独特之处在于,它不是在已有架构上"做减法",而是从模型设计的源头实现了效率与能力的平衡。
传统 Transformer 模型在处理长文本时,注意力计算的复杂度呈二次方增长。这意味着随着上下文窗口从几千 Token 扩展到 100 万 Token,计算成本将膨胀到不可接受的程度。MSA 的核心突破在于:它通过一种全新的稀疏模式,在保持模型表达能力的条件下,大幅降低了长上下文场景下的计算开销。
这种架构创新的直接效果是:M3 在 1M 超长上下文场景下的推理成本,显著低于同等参数规模的稠密模型。对于需要处理大量代码库、完整项目文档或超长对话历史的 Agent 场景而言,这意味着"用得起的超长上下文"开始成为现实。
值得强调的是,M3 的原生多模态能力并非简单拼接。模型从 Step 0 开始就采用图文音统一训练框架,与先训练纯文本模型再额外接入视觉/语音模块的"后装"路径有本质区别。这种原生设计使其在多模态理解任务中表现出更好的跨模态推理一致性——对于一个需要同时理解代码截图、流程图和自然语言描述的 Agent 来说,这是关键的基础能力。
二、编程与 Agent 能力的"双料突破"
M3 的评测成绩在行业内外引发了广泛讨论。在 SWE-Bench Pro 上,M3 取得了 59.0 分的成绩,超越 GPT-5.5(行业暂未披露具体分数)和 Gemini 3.1 Pro,仅次于最新发布的 Claude Fable 5。在 Terminal Bench 2.1 上,M3 同样展现出强劲的终端 Agent 任务执行能力。
真正值得关注的是,这些成绩是在激活参数仅 23B 的条件下取得的——M3 的 MoE 混合专家架构使其尽管总参数高达 428B,但每次推理仅激活 23B 参数。这种"总规模大、激活规模小"的设计,既保障了模型的知识容量和推理质量,又控制住了推理成本。对于开发者和企业而言,这意味着用更低的成本就能获得接近顶尖闭源模型的 Agent 编程能力。
从技术路线来看,M3 在这一代模型中的定位非常明确:不是为了在每一个基准测试上碾压所有对手,而是首次将"前沿编程能力 + Agentic 智能体工作流 + 超长上下文 + 原生多模态"这些原本分散在不同模型上的能力,整合到了一个开源模型中。这一组合,恰好切中了当前 AI Agent 开发中最核心的四大需求。
三、Day-0 适配:国产算力协同的新范式
6月12日 M3 开源当天,国产 GPU 企业摩尔线程同步宣布,旗下旗舰 AI 训推一体智算卡 MTT S5000 完成了对 M3 的 Day-0 极速适配。这听起来像一条普通的企业新闻,但放在产业背景中看,意义远不止于此。
2025年之前,国产大模型与国产 GPU 之间的适配周期通常是数周到数月。大模型厂商与芯片厂商的研发节奏不同步,导致模型发布后,国产硬件用户需要等待很长时间才能获得可用体验。M3 与 MTT S5000 的 Day-0 适配,意味着这两条产业链之间的协同效率已经提升了一个数量级。
这种协同背后有技术也有机制的因素。技术层面,M3 采用的 MoE 架构建模方式与 MTT S5000 的异构计算架构天然匹配,稀疏注意力计算的特性也更适合在国产 GPU 上优化部署。机制层面,MiniMax 和摩尔线程之间建立了开源协同流程,模型权重发布与适配验证并行推进,才能实现"同一天可用"的效果。
对于企业用户而言,这意味着"国产大模型 + 国产算力"的闭环正在从理论走向现实。在信创环境和数据主权要求愈发严格的背景下,这一闭环的价值不能被低估。
四、开源生态的连锁反应
M3 的开源协议采用了较为开放的许可方式,允许商业使用和二次开发。这一决定正在产生连锁反应。
在社区层面,M3 发布后一周,GitHub 上便涌现出多个基于 M3 的微调版本和垂直场景适配项目。开发者利用 M3 的 Agentic 能力,快速搭建了代码审查助手、文档智能体、数据洞察 Agent 等应用原型。由于 M3 的激活参数仅 23B,很多个人开发者甚至可以在消费级 GPU 上运行微调和推理。
在企业层面,多家国产 AI 开发和部署平台已经宣布接入 M3。这与 M3 在编程和 Agent 场景上的出色表现直接相关——对于正在搭建企业内部 Agent 工具链的企业而言,一个开源、低成本、能力接近顶尖闭源水平的模型,无疑比 API 计费模式更有吸引力。
值得注意的是,M3 的开源恰逢中国大模型周调用量连续六周超越美国的行业拐点。据公开行业数据,中国大模型 API 调用量已在全球领先,而 M3 这样兼具开放性和高性能的开源模型加入,有望进一步加速这一趋势。
五、国产大模型的"双轨并行"格局
回看 2026 上半年的国产大模型战场,一个清晰的格局正在形成:DeepSeek 以巨额融资和开源生态为核心竞争力,智谱 GLM 系列以政企场景为突破口,Kimi 以 C 端体验见长,MiniMax 则凭借 M3 的架构创新和编程/Agent 能力,形成了自己的差异化身位。
MiniMax 在这条路线上的选择颇具前瞻性:其海外收入占比已超过 70%,是国内最早实现自负盈亏的大模型创业公司之一。M3 开源后的生态发展,将检验一个"技术突破 → 开源 → 生态反哺商业"的正向循环能否跑通。
对于整个行业而言,M3 的开源意义不仅在于一个模型的开放。它证明了在 Model-as-a-Service 几乎成为行业共识的 2026 年,开源路线依然能诞生具备前沿竞争力的模型。更重要的是,MSA 稀疏注意力架构为长上下文场景提供了一种"用得起"的工程方案,这正是 AI Agent 从"演示可用"走向"生产可用"所急需的基础设施能力。