AI 模型在传统 benchmark 上一路刷新 SOTA,但在真实工作场景中为什么还是频频"翻车"?加州大学伯克利分校牵头、联合 250 余位行业专家组成的研究团队给出了一个直击痛点的回答:问题不在 AI 本身,而在评估体系。

2026 年 6 月上旬,研究团队正式发布了 Agents' Last Exam(ALE)——一个旨在衡量 AI Agent 在真实、长流程、具有经济价值的专业工作场景中表现的新基准。而评测结果让人清醒:在当前最难一级的任务中,最好配置的完成率也只有 8.6%,主流系统的平均完整通过率仅 2.6%。

为什么叫"最后的考试"?

ALE 之"最后",有两层含义。第一层是针对能力门槛——只有当前 AI Agent 真的能通过这场考试,才算具备了持续完成真实专业工作的能力,benchmark 上的数字再漂亮也没用。第二层是针对难度前沿——基准中的任务直接来自各行业专家日常工作中的真实需求,是最能反映"AI 能不能真的帮人类干活"的测量工具。

基准的名称也许有些夸张,但背后的逻辑很清晰:如果 AI 想从"聊天机器人"进化到"数字员工",它必须能够通过这场针对实际工作能力的终极检验。

1490 个真实任务:从 3D 建模到绿幕合成

研究团队收集了 1490 个任务,覆盖制造、法律、医疗、视觉媒体等多个领域。这些任务全部来自真实从业者的日常工作——有些要求 AI 画出 3D 模型,有些要求它在 DaVinci Resolve 中完成绿幕抠像和视频合成,有些则要求在专业工程软件中进行注塑仿真并提取关键数值。

研究团队把这类能够胜任这些任务的 Agent 定义为 Generalist Computer-Use Agent(GCUA)——它不仅需要能操作界面,还得会跑命令行、处理文件、写代码、调用工具,完成一整套工作流程。

为了确保评测的客观性,ALE 提供了完整的可执行和评分环境。93.2% 的任务支持自动判分,无需人工干预。这意味着评测结果不仅可复现,且排除了主观评分偏差。

成绩单:8.6% 与 2.6% 的两个数字

评测结果可以用两组数字概括。如果只看最难一档的任务,当前表现最好的配置是 Codex + GPT-5.5,完整通过率也只有 8.6%。研究团队给出的主流系统平均完整通过率则是 2.6%。

特定任务的失败案例更为直观。在音乐转谱任务中,AI 需要提交总谱 PDF、MIDI 文件和界面截图,但最终只导出了 MIDI 文件,得分为 0。在注塑仿真任务中,AI 在 Moldex3D 中完成了仿真并导出结果,但没能稳定提取关键数值,得分仅 0.4762。在绿幕合成任务中,AI 虽然完成了视频导出,但没有满足参考要求,同样得分为 0。

研究团队还对 Claude Code + Opus 4.7 的任务失败原因进行了分类:31% 属于理解问题,47% 属于方法问题,22% 属于执行问题。理解与方法问题合计约占八成,这表明当前系统的主要瓶颈在于领域知识不足,而非执行能力的欠缺。

模型比框架更重要:18 个百分点 vs 5 个百分点

ALE 还带来了一组值得行业思考的对比数据。研究团队比较了模型选择和 Agent 框架对任务完成率的影响。结果显示:固定 Agent 框架、只更换模型时,整体通过率最高和最低之间相差 18 个百分点;而固定模型、只更换 Agent 框架时,这个差距只有约 5 到 6 个百分点。

这意味着模型选择带来的影响范围大约是 Agent 框架的三倍。对于正在做技术选型的团队来说,这组数据传达了一个明确的信号:先选好模型,再考虑框架,可能是更高效的技术决策路径。

对行业的意义:benchmark 的信任危机

ALE 的发布在 AI 行业引起了广泛讨论。过去一年,主流模型在传统基准测试上的得分不断攀升,但企业和开发者在实际部署中的体验却未能同步提升。这种"基准分数高、实际表现差"的脱节,正在侵蚀 benchmark 作为评估工具的信任度。

ALE 试图解决这个问题——用真实工作任务代替人工设计的测试题,用可执行的评分环境代替静态的问答匹配。虽然目前不同领域的任务覆盖仍不均衡(能源与核工程仅 4 个任务,法律领域 15 个),但研究团队明确表示 ALE 是一个持续更新的基准,未来会逐步扩展任务池。

对于 AI Agent 行业而言,ALE 最重要的贡献不是给出"当前模型不够好"的结论——这个结论大多数从业者早有感知。它的真正价值在于,为行业提供了一个可量化的、面向真实工作能力的参考标尺。当模型厂商声称"我的模型更强"时,除了传统 benchmark 的数字,现在还可以用 ALE 来检验:这个模型真的能完成一项真实的工作任务吗?

← 上一篇:OpenClaw v2026.6.6 发布深度解读 返回资讯首页 →