← 返回首页

Mercury 2.5

Inception Labs

迄今最大扩散语言模型,1107 token/秒,质量接近前沿、成本大幅降低

扩散模型 模型
B+
高速扩散式语言模型新锐
⭐⭐⭐⭐

📖 产品简介

Inception Labs 于 2026 年 9 月 11 日发布 Mercury 2.5,迄今训练规模最大的扩散式语言模型(diffusion LM)。

在常见 Nvidia GPU 上可达约 1107 token/秒,上下文窗口 260K。质量接近成本优化的前沿模型(GPT-5.6 Luna Low、Gemini 3.5 Flash-Lite、Claude Haiku 4.5)水准,同时推理成本大幅下降。发布折扣价低至 8 折:$0.04 / 百万输入 token、$0.15 / 百万输出 token。扩散式 LM 在质量接近经典自回归模型的同时,规模推理成本显著更低,进一步加剧日常 AI 的价格下行压力。

定位
迄今最大扩散语言模型,1107 token/秒,质量接近前沿、成本大幅降低
适合人群
高并发/低延迟文本生成 成本敏感的 API 用户 需要长上下文的应用 关注推理降本的团队
支持平台
API、云端
开源

核心功能

  • 🚀 1107 token/秒:在常见 Nvidia GPU 上达到的高吞吐
  • 🪟 260K 上下文窗口,适配长文档与多轮任务
  • 💲 发布折扣 8 折:$0.04/M 输入、$0.15/M 输出 token
  • ⚖️ 质量接近前沿性价比模型(GPT-5.6 Luna Low / Gemini 3.5 Flash-Lite / Claude Haiku 4.5)
  • 🌊 扩散式架构:批量去噪生成,规模推理成本显著低于自回归
  • 📉 加剧日常 AI 价格下行压力,利好高并发场景

⚖️ 优缺点分析

👍 优点

  • 扩散 LM 首次在质量接近前沿的同时实现数量级提速
  • 1107 token/秒 高吞吐,适合高并发/低延迟场景
  • 发布折扣价极具竞争力
  • 260K 长上下文
  • 验证扩散式 LM 可作为自回归的可行替代

👎 缺点

  • 作为新架构,生态与工具链成熟度不及自回归主流模型
  • 长上下文与复杂推理的边界仍待独立验证
  • 厂商基准,需真实负载复核
  • 仅 API/云端提供,未见开源权重

📊 评分详情

功能完整
8
易用程度
8
安全可靠
7.5
性价比
9

💬 用户评价

Mercury 2.5 证明扩散式 LM 不只是玩具——1107 token/秒还能接近前沿性价比,价格战又被推了一把。

📝 更新日志

  • 2026-09-11
    v2.5 发布
    Inception Labs 发布 Mercury 2.5,迄今最大扩散语言模型:约 1107 token/秒,260K 上下文,质量接近 GPT-5.6 Luna Low / Gemini 3.5 Flash-Lite / Claude Haiku 4.5,发布折扣 $0.04/M 输入、$0.15/M 输出 token,进一步压低日常 AI 价格。