长时程任务里,智能体真正的成败往往不在收尾那一步,而在中途的几个岔路口:选哪个假设先验证、基于哪份实现继续改、要不要为省时间绕开某个工具。业内习惯把这种能力叫「品味」——人人都在说,从没人认真测过。微软研究团队牵头、联合高校研究者在 9 月 22 日提交的论文 The Tasteful Agent(arXiv 2609.25804)把这个词变成了可测量的基准,给出的答案并不体面:前沿模型在这类选择题上只拿 59.7%。
Taste-Bench 的构造思路是反着来的。现有基准测端到端成功率,分叉决策被埋进最终结果里看不见;Taste-Bench 干脆把分叉挖出来当题。挖掘完全自动化,来源有两条:一是同一任务的多次并行尝试,不同模型选了不同方向、结局有好有坏,分叉处自然浮现;二是单条轨迹内部的绕路折返——智能体跑到某处又退回重选。每个分叉变成一道选择题,正确方向由事后结局背书,全程无需人工标注。答题时,模型只看得到分叉之前的上下文,不知道后面发生了什么。
结果先泼了两盆冷水。其一是上限低:表现最好的前沿模型只有 59.7%,而这些分叉全是真实智能体在真实任务里到过的岔路,不是对抗构造出来的陷阱题。其二是证据滞后效应:决定性信息要到轨迹后段才出现的分叉,各模型集体失手——先做承诺、后见证据,恰恰是长时程工作的常态,也是模型最不擅长的处境。更扎心的是第三条发现:加大推理预算几乎不涨分。多想,并不能想出好品味。
建设性的一半在于品味可教。研究者让一个能看到任务结局的教师模型对分叉做出判断,再把这份判断力蒸馏进学生模型:学生不仅在未见过的任务上做出更好的决策,在留出的 SWE-bench Pro 端到端评测上也有实打实的提升——信号确实迁移出了基准本身,这是多数基准论文迈不过去的一道坎。代码与数据集均已开放,复现门槛不高。
这篇论文最有价值的暗示,是对失败归因的重排。业界习惯把长任务失败笼统归为「模型能力不够」,Taste-Bench 给出的图景更精确:很多长程任务的失败,其实是三四个关键节点的决策质量塌方。归因错了,药方也会错——堆推理时算力是被这篇论文明确排除的选项,修轨迹数据、建蒸馏管线才是对症的做法。这也与此前的 harness 价值分解类研究接上了榫:外挂组件的收益各有账可算,而中间决策质量是其中最没被测过的一环,如今终于有了专门的量尺。
把 Taste-Bench 与近期的其他评测排在一起看,分工就清楚了。APEX-Agents 之类的职业任务基准测的是端到端完成率,前沿模型在投行、咨询、法务的完整工作流上通过率一度只有两成出头;Taste-Bench 把这个黑箱拆开了一层——端到端的低分里,有多少来自知识不够、有多少来自工具失败、又有多少来自中途那几次「选错了方向」,如今「方向选错」这一项有了独立读数。三层读数拼起来,改进路线也随之分层:知识短板补数据,工具失败修容错,决策塌方练品味——各有各的管线,不能再一锅炖。
对评测使用者的实操建议也藏在挖掘方法里:分叉银行的构建逻辑完全可以直接搬进自家团队——把历史运行里的并行尝试和折返轨迹攒起来,让事后结局当裁判,就能低成本产出一套贴合自家任务的「品味考卷」,既能量化新版模型在关键节点上的判断力变化,也能定向采集蒸馏数据。比起笼统的回归测试,这种考卷能指出「这次升级到底是变聪明了,还是只是话术变好了」。
边界也要摆一摆。自动挖分叉意味着题目分布受源轨迹约束,59.7% 的分母是「真实到达过的分叉」,换到别的任务域数字未必一样;蒸馏的上限由教师决定,而教师看得见结局这件事,在生产环境里并不总成立——很多场景的结局要等很久才揭晓,甚至永远没有干净的标签。论文全文 33 页,基准刚发布,第三方复测数据目前官方及行业暂未披露更多细节,后续将持续跟进迭代动态。但方向值得每个做长时程智能体的人记下:与其在终点上卷成功率,不如回头审一审中途那几个岔路口,模型到底是怎么选的。