9 月 8 日,Anthropic 的 ClaudeDevs 团队(Lance Martin、Brad Abrams、Isabella He、Ben Lehrburger)发布官方指南《Reducing cost and improving performance with Claude Platform》。核心观点反直觉:很多 Claude 应用最大的浪费不是模型选错,而是沿用了一年追弱模型留下的提示词习惯,以及迁移后没人复看的缓存配置。文章给出三招,在多个公开 benchmark 上实测降本 52%–73% 且性能持平或提升,并已封装进 claude-api skill 供 Claude Code 直接调用。
一、Prompt Cache:免费的「第一杠杆」
Claude 在生成回复前要先做 prefill(把 prompt 处理成内部状态),这是每次请求最贵的部分。Prompt cache 把这份 KV 状态存下来,后续以相同前缀开头的请求直接读缓存而非重算,缓存读取价仅为全价输入的一小部分。关键约束有三条:缓存绑定具体模型(中途换模型必失手)、读取要求前缀逐字节一致(改一个字符就全废)、TTL 有限(默认 5 分钟,可申请延长到 1 小时)。常见「缓存杀手」包括:对话中途改 effort(会渲染进前缀)、系统提示里塞时间戳或 UUID、工具定义自动重排。Anthropic 实测在 tau2-bench retail 上靠缓存最高砍掉 73% 成本,且通过率基本不动。
二、清除旧模型留下的提示词反模式
很多提示词里还残留着「修补老模型短板」的指令,升级到前沿 Claude 后反倒成了累赘。指南点名了六类反模式,移除后实测降本 14.6%、准确率还提升 5.3%。这一步几乎零成本——本质是删掉死重。对应的 /claude-api prompt-audit 命令会自动扫描代码库里的提示词反模式。
三、按任务校准 effort,而非一味拉满
effort 参数控制模型「想得多认真」。指南强调:不是所有任务都值得开最高 effort。在 CursorBench 3.2 上,Fable 5.1 低 effort 以约 1/3 成本达到 Fable 5 高 effort 的效果。盲目拉满 effort,等于为简单任务付了复杂任务的账单。对应的 /claude-api hillclimb 命令会按真实 benchmark 帮你找到每个任务的最优 effort 档位。三招合起来(缓存+去反模式+校准),在四个公开 benchmark 上整体降本 52%–73%——对正在把 Agent 工作流规模化、却被 token 账单追着跑的团队来说,这份指南比任何新模型发布都更实在。