一道不用人工出的题

编码智能体的评测,长期依赖人工设计的题库。这套做法有一个结构性麻烦:出题人想出来的任务,和开发者真实遇到的任务往往不是一回事。前者为了便于评分,会刻意把问题描述清楚、边界划干净;后者恰恰相反,需求模糊、上下文缺失、边界含糊,而这正是智能体最容易出错的地方。

Cursor 给出的解法是绕开出题这个环节。它更新的私有基准 CursorBench 4.0,核心机制叫 Cursor Blame:把仓库里已经提交的代码,追溯回生成它的那次智能体请求。代码既然已经被开发者提交,说明它被认可了;而它对应的那次请求,就是这道题的题干。于是「开发者查询—标准答案」的配对天然形成,不需要人工编写。

需要说明的是,该基准为厂商私有,题库不对外开放,外部研究者无法独立复核题目与评分逻辑,官方及行业暂未披露更多细节,后续将持续跟进迭代动态。本文讨论的是它公开的设计思路与分数表现,不代表对基准公正性的结论。

三个设计选择

官方在介绍里给出了三点配套设计,每一点都对应一类已知的评测失效。

其一是防泄漏。任务多来自内部代码库与受控来源,并且每隔数月整体更换题库。这一条针对的是训练数据污染——当题目在互联网上流传久了,模型可能「背过」答案,分数就不再反映能力。整体轮换是比打补丁更彻底的应对,代价是纵向可比性被打断。

其二是任务更重。从初版到 3.x 版本,任务规模大约翻倍,大于业界常用的代码基准各变体,并引入了 monorepo 多工作区、排查生产日志、长时实验这类任务。这些任务的共同点是「一次回答解决不了」,需要跨多轮、跨多文件地持续推进。

其三是刻意保留歧义。任务描述简短、信息不充分,模拟真实的表达方式,而不是为了便于评分而人为消除不确定性。这一条是最反直觉的:传统基准追求评分客观,会尽量把任务描述写清楚;而这里的判断是,把歧义消掉之后,测的就不再是真实场景里的能力了。

分数为什么集体下降

新版本发布后,一个显著现象是所有被测模型的分数都比上一版低。这不是模型退步,而是题目变难了——更长的任务周期、更严格的指令遵循要求、以及被刻意保留的歧义,共同压低了通过率。

公开数据里,领跑的是某个前沿模型的高配档位,得分约 51.8%,但单任务成本约 17.28 美元;紧随其后的是同系列的另一档,约 46.6%。一个值得注意的性价比点是某款以效率见长的模型,得分约 41.6%,而单任务成本只有约 2.64 美元——分数略低,价格差了数倍。其他几款模型分布在 34% 到 42% 之间,价格与分数的组合各不相同。

这里有一个容易被误读的地方:不同模型的价格口径与任务定义不完全一致,分数也不可直接横向比较。真正有信息量的是「分数与成本的组合」,而不是单一分数。同一份榜单同时给出成本、Token 用量与每任务步数,正是为了让选型者看到取舍曲线,而不是只看排名。

线上线下双闭环

这套评测比较特别的地方,是它承认离线评测不够用。官方描述的评测理念是两条线并行:线下衡量正确性、代码质量、效率与交互行为;线上则在真实流量里做受控实验,专门捕捉一类回归——「离线得分高,但用户体验更差」。

这类回归在实际产品里很常见。一个改动可能让基准分数上升,却让回答变得更啰嗦、更慢,或者更倾向于做一些用户并不想要的改动。只有把线上信号纳入闭环,才能发现这种偏差。这也是私有基准相对公开基准的一个结构性优势:它可以同时看到离线与线上两侧的数据。

一个消融案例说明的事

官方还给出了一个消融案例,读起来比分数更有启发。他们移除了某个语义搜索工具,结果才准确定位出这个工具的价值集中在「大型代码库的仓库级问答」这一场景——在别的场景里,它的存在感并不明显。

这个案例说明的是:一个工具到底有没有用,很多时候只有把它拿掉才能知道。这对工程团队有直接借鉴意义——在评估自己为智能体加的各种工具与能力时,除了「加上去有没有变好」,还应该做「拿掉会不会变差」的对照。前者容易受安慰剂效应影响,后者更接近真实贡献。

中立思辨

需要辩证看待几件事。其一,私有基准不可外部复核,这既是防泄漏的手段,也是可信度的短板——外界无法验证题目是否具有代表性、评分逻辑是否公正,只能选择相信。其二,用「已提交的代码」反向出题可能引入选择偏差:只有被采纳的代码才会成为题目,而被开发者拒绝、修改或返工的请求不会进入题库,这部分恰恰包含大量失败样本,长期看可能让基准低估真实难度。其三,题库整体轮换切断了纵向可比性,虽然避免了泄漏,但也让「这一版比上一版强多少」这类问题失去答案,评测的长期趋势判断因此变得困难。其四,厂商自建基准天然存在利益关联,即便方法本身合理,也需要第三方交叉验证才能作为公共结论使用。其五,分数与成本的组合虽然更有信息量,但成本口径受订阅方式、批处理折扣与缓存命中影响很大,不同团队的实际支出可能与榜单价格差异显著。其六,刻意保留歧义提升了真实性,也提高了评分的主观性,如何在这种设定下保持评测的一致与可复现,是方法本身需要持续回答的问题。

趋势研判

短期看,私有基准会成为头部编码智能体产品的标配,因为公开题库的失效速度已经快于其维护速度;中期看,如果这类「从真实会话反向出题」的方法被广泛采用,评测的重心会从「设计更难的题」转向「采集更真实的样本」,而样本采集的合规与隐私问题会成为新的约束;长期看,评测可能会分化为两层:一层是公开、可复核、用于横向比较的公共基准,另一层是私有、持续轮换、用于内部回归的厂商基准,两者承担不同职能,而不是互相替代。

对正在做模型选型的团队来说,一个务实的做法是不要直接采信任何单一榜单的排名。更可靠的方式是准备一套自己的任务集,取自团队真实提交过的代码与真实遇到过的需求,然后在同一套任务上比较候选模型与成本。这件事的工程量不大,但得到的结论比任何公开榜单都更贴合自己的场景。