7月15日,DeepSeek-V4正式版全量上线。据AI智能体信息日报援引官方动态,本次上线的Pro版参数为1.6万亿总参、490亿激活,Flash版为2840亿总参、130亿激活,两个版本均支持百万token上下文,并首次引入API峰谷定价机制,Agent能力与推理性能同步升级。对高频调用、负载波动明显的智能体场景而言,这不仅是一次模型迭代,更是一次计费范式的试探。

一、正式版落地:双档规格,百万上下文成标配

本次全量上线的V4延续了DeepSeek一贯的MoE(混合专家)路线:Pro版以1.6万亿总参数、每次推理仅激活490亿的参数效率,主打高质量长任务;Flash版以2840亿总参、130亿激活,偏向高吞吐与低延迟。两者都把上下文窗口拉到百万token级别——这意味着智能体可以在一次会话中容纳更长的文档、更多轮的对话历史与更完整的工具调用记录,对需要「记得住、读得长」的Agent任务尤为关键。

二、计费创新:首次引入API峰谷定价

真正值得关注的是定价机制。V4首次引入API峰谷定价——即在不同时段(闲时与忙时)给出差异化的调用价格。对Agent工作负载来说,这击中了真实痛点:智能体的调用曲线往往高度不均,批量检索、夜间训练、定时巡检等任务本就可以错峰执行,却长期按统一高价计费。峰谷定价把「什么时候调用」变成了成本变量,让开发者和企业有机会把非实时任务调度到低价时段,直接摊薄长周期、高频次任务的总账单。

三、为什么对Agent重要:成本结构决定落地半径

大模型能力趋于commodity之后,Agent竞争的胜负手越来越落在「跑得起、跑得稳、跑得便宜」。一个需要连续调用数十次工具、反复读写长上下文的智能体,其真实成本主要由「调用次数×单次价格×上下文长度」决定。百万上下文减少了分块与拼接的损耗,峰谷定价则压低了均值单价——两者叠加,等于给长任务Agent松了一道成本绑。对于把Agent嵌进生产流程的企业而言,这类「工程侧+计费侧」的双重优化,往往比单纯堆参数更影响采购决策。

四、客观看:峰谷定价是利好,但落袋还需配套

理性评估,V4正式版的全量上线与峰谷定价,对Agent开发者是明确的利好:更长的上下文、更灵活的成本结构,降低了把智能体跑进生产环境的门槛。但也要看到,峰谷定价的红利能否兑现,取决于调度能力——如果业务天然强实时、无法错峰,闲时低价就享受不到;而百万上下文带来的显存与延迟压力,也需要工程侧配套优化。此外,本次正式版的诸多工程细节(如具体单价档位、各档激活策略)行业暂未完整披露,实际降本幅度仍有待开发者实测验证。可以确定的是,当模型厂商开始把「怎么计费」当作产品力来设计,Agent的商业化基础设施又成熟了一寸。