📖 产品简介
Inception Labs 于 2026 年 9 月 11 日发布 Mercury 2.5,迄今训练规模最大的扩散式语言模型(diffusion LM)。
在常见 Nvidia GPU 上可达约 1107 token/秒,上下文窗口 260K。质量接近成本优化的前沿模型(GPT-5.6 Luna Low、Gemini 3.5 Flash-Lite、Claude Haiku 4.5)水准,同时推理成本大幅下降。发布折扣价低至 8 折:$0.04 / 百万输入 token、$0.15 / 百万输出 token。扩散式 LM 在质量接近经典自回归模型的同时,规模推理成本显著更低,进一步加剧日常 AI 的价格下行压力。
定位
迄今最大扩散语言模型,1107 token/秒,质量接近前沿、成本大幅降低
适合人群
高并发/低延迟文本生成
成本敏感的 API 用户
需要长上下文的应用
关注推理降本的团队
支持平台
API、云端
开源
否
✨ 核心功能
- 1107 token/秒:在常见 Nvidia GPU 上达到的高吞吐
- 260K 上下文窗口,适配长文档与多轮任务
- 发布折扣 8 折:$0.04/M 输入、$0.15/M 输出 token
- 质量接近前沿性价比模型(GPT-5.6 Luna Low / Gemini 3.5 Flash-Lite / Claude Haiku 4.5)
- 扩散式架构:批量去噪生成,规模推理成本显著低于自回归
- 加剧日常 AI 价格下行压力,利好高并发场景
⚖️ 优缺点分析
👍 优点
- 扩散 LM 首次在质量接近前沿的同时实现数量级提速
- 1107 token/秒 高吞吐,适合高并发/低延迟场景
- 发布折扣价极具竞争力
- 260K 长上下文
- 验证扩散式 LM 可作为自回归的可行替代
👎 缺点
- 作为新架构,生态与工具链成熟度不及自回归主流模型
- 长上下文与复杂推理的边界仍待独立验证
- 厂商基准,需真实负载复核
- 仅 API/云端提供,未见开源权重
📊 评分详情
功能完整
8
易用程度
8
安全可靠
7.5
性价比
9
💬 用户评价
Mercury 2.5 证明扩散式 LM 不只是玩具——1107 token/秒还能接近前沿性价比,价格战又被推了一把。
📝 更新日志
-
2026-09-11v2.5 发布Inception Labs 发布 Mercury 2.5,迄今最大扩散语言模型:约 1107 token/秒,260K 上下文,质量接近 GPT-5.6 Luna Low / Gemini 3.5 Flash-Lite / Claude Haiku 4.5,发布折扣 $0.04/M 输入、$0.15/M 输出 token,进一步压低日常 AI 价格。