一个被很多人忽略、却可能比单次基准登顶更重要的信号:9 月 3 日数据显示,全球每百万 Token 推理均价已跌破 1 美元,创下年内新低。当头部闭源模型还在以 10–50 美元每百万 Token 的单价讲述「高价值」故事时,底层均价已被悄悄拉到 1 美元以下。这场价格雪崩的背后,是中国低成本开源模型对全球价格锚点的系统性重塑。

一、谁把价格打下来的

核心推力是国产低成本开源模型:DeepSeek、月之暗面 Kimi、智谱 GLM、阿里 Qwen 等普遍采用 MoE 架构 + 开放权重策略——用稀疏激活降低单次推理成本,用开放权重让开发者自部署、自优化。当一批质量够用、价格极低的模型大量可供选择,「闭源模型贵有贵的道理」的叙事就开始松动。

两个具体动作很有代表性。其一,阿里将 QoderWork、MuleRun、Wukong 合并为职场智能体 QwenWork,标准层采用 Qwen3.8 Flash,单任务 Token 消耗可降低约 75%;其二,Qwen3.8-Max-0902 登顶 Code Arena WebDev(1691 分),领先 Opus 5 Max 约 3 分。一边降本、一边登顶,开源阵营把「性价比」做成了武器。

二、定价机制本身也在进化

更微妙的变化在计价方式。9 月 3 日 0 点生效的 DeepSeek V4 新定价取消了统一计费,改为按算力峰谷浮动:9:00–12:00、14:00–18:00 为高峰时段,价格是低谷的 2 倍。这把云服务的「分时电价」逻辑搬进了大模型——既引导用户错峰、平滑算力负载,也把成本波动透明地转嫁给调用方。

同一周内,Anthropic 把 Fable 5.1 的缓存读取价砍到 0.25 美元(降 75%)。缓存读取是 Agent 长任务里最频繁发生的调用,这一刀直接削掉了高频场景的账单厚度。可见,「降价」不再只是促销话术,而是计价结构被重做。

三、从「谁最强」到「谁最省完成任务」

价格跌破 1 美元这个节点,标志着竞赛维度的迁移。过去一年,厂商比的是 benchmark 登顶、上下文长度、多模态能力;现在,企业采购更关心一个朴素问题:「完成一项真实任务,到底花多少钱」。

这恰恰对 Agent 落地最友好。Agent 的价值在于「干完一整件事」,而一件事往往意味着成千上万次工具调用、长上下文与多轮迭代——单价每降一档,端到端成本就指数级改善。当均价跌破 1 美元,很多原本「算不过账」的自动化场景,第一次有了经济可行性。

四、客观看:低价不是免费,也非终点

积极面毋庸置疑:推理成本下降直接降低创业与试错门槛,让中小团队也能把 Agent 跑进生产;分时定价与缓存降价则逼着厂商把「省 Token」做成工程能力,而非营销口号。

但三点需要冷静。第一,均价 ≠ 你付出的价:旗舰模型单价仍高,低价主要来自开源/小模型与促销层,企业核心业务若依赖最强模型,账单未必跟着均值走。第二,峰谷定价转移了波动性:错峰能省钱,但高峰期价格翻倍,对实时性强的业务是真实成本。第三,价格战可能牺牲长期投入:当毛利被压薄,模型研发与安全的持续投入能否维系,需要观察。

结语:Token 均价跌破 1 美元,不是一次简单的促销,而是 AI 从「奢侈品」迈向「水电煤」的又一块里程碑。国产开源模型扮演了「价格鲶鱼」的角色——它未必在每个维度都最强,却足以让整个行业重新回答那个最根本的问题:智能,到底该值多少钱。