Inception Labs 于 9 月 8 日发布 Mercury 2.5,采用扩散式(非自回归)生成范式,在常见 NVIDIA GPU 上实现 1107 token/秒吞吐、260K 上下文,发布价低至 0.04 美元/百万输入 token。这家由斯坦福、UCLA、康奈尔学者创立的公司,正把「扩散语言模型」从论文概念推到生产级 API。

一、它和 GPT、Claude 有什么不同

主流大模型(含 GPT-6、Claude、Llama)都是自回归的:逐 token 从左到右生成,每个 token 依赖前一个。Mercury 2.5 不走这条路,而是扩散式语言模型(dLLM)——先生成整段响应的「遮罩草稿」,再在多次迭代中并行精修所有 token。双向注意力让模型在每一步都能看到前后文,可在生成中途纠正早期错误,这是自回归模型一旦提交 token 就无法回改的物理限制。

二、速度数字与适用面

Inception 称 Mercury 2.5 质量对标成本优化型前沿模型(Gemini 3.5 Flash-Lite、Claude Haiku 4.5、GPT-5.6 Luna Low),发布价 0.04 美元/百万输入、0.15 美元/百万输出(标价的 80% 折扣)。公司列举 OpenCall 语音 Agent 将 P99 响应从数分钟压到 1 秒、Augment Code 上下文压缩延迟降 82%、成本降 90% 等生产案例。上述为厂商自报、未经独立复现,且社区指出其速度对比多引用落后数版的竞品模型。

三、客观判断:快,但不是万能

Mercury 2.5 的优势集中在高并发、低延迟、海量调用的场景——查询改写、RAG 摘要、语音 Agent 应答、代码自动补全;社区也指出其在复杂 agentic 编码、长链推理与长文连贯上仍弱于前沿自回归模型,工具生态也落后数年。合理的落地策略是把延迟敏感、调用频繁的工作路由给 Mercury,把推理重、长程的任务留在前沿模型上。扩散架构能否从研究奇观变成推理账单上的常驻项,未来两个季度是关键观察窗口。