榜单换了考法
国际表格 AI 评测 SpreadsheetBench 更新了 V2 Full 榜单。据 9 月 13 日的公开报道,WPS AI 表格 Agent 以 50.86% 的综合成绩排名居首,并通过官方 Verified 验证;同一榜单中,几个国际主流模型分别以 34.89%、26.79% 与 23.68% 的成绩位列其后。报道同时称,这是该产品三个月内第三次登顶。
更值得关注的是考法的变化。V2 共 321 项任务,平均每项涉及 11.8 个工作表与 593.5 个单元格修改。评测关注的是 AI 对复杂表格的整体处理能力,包括理解、计算、排错、做图与最终交付。
换句话说,它考察的是 AI 能否把一份复杂工作簿完整处理并交付,而不是能否回答一个关于表格的问题。
这类任务的执行链路至少有三段
从表格任务的执行链路看,通常至少涉及三个环节。先识别表头、数据区域、公式引用与跨表关系;再对单元格、公式、格式、图表等进行实际操作;最后重新计算、检查引用与文件状态,确认结果可以继续使用。
这意味着复杂表格任务拼的不只是一次模型推理,还包括对文件结构的理解、对软件能力的调用,以及对结果的校验。三者缺一,交付就会断在中间。
这也解释了为什么榜单成绩与模型参数规模并不直接对应。表格任务属于场景数据与工具链深度耦合的活:模型需要理解的是工作簿这种具体对象,需要调用的是电子表格软件本身的能力,需要在操作之后回到文件层面做一致性检查。这些能力来自办公软件长期的工程积累,而不是单次推理的强度。
把「懂业务」拆成可执行的方法论
同一时期,该产品团队在区域企业活动上披露了组织级 AI 落地的方法论,概括为通知识、通数据、通能力,管好成本与安全,并以统一平台作为基座。其负责人给出的表述是:要做的不是给员工一个聊天窗口,而是让 AI 理解数据、组织与业务。
公开信息显示,相关办公套件已在部分省份覆盖多个地市与省属国有企业。这类披露属于企业侧口径,用于说明落地范围,而非效果指标。
在技术积累层面,团队还有一项面向复杂办公图像处理的研究被国际文档分析会议收录并现场展示。该研究聚焦 AI 生成文档图像、手机截图等素材中的文字识别与文档还原问题,通过优化图像色彩特征提取与噪声抑制,提升文字颜色属性识别与文档细节还原效果,对应的是图片转文档、PDF 处理、版式还原等日常高频需求。
一项是表格工作流的第三方评测,一项是文档图像处理的学术评审,分别对应「执行复杂办公任务的能力」与「底层文档处理的技术积累」。两者共同构成了这类办公 Agent 的能力底座。
竞争在同一个方向上收窄
办公 Agent 的执行能力正在成为考核核心。近期同类动作密集:有产品上线多 Agent 并行功能,有平台宣布开放平台正式上线,也有产品通过接入新模型提升标准模式下的单任务生成速度。方向趋同,说明这一层的竞争焦点已经落到「能否把一件完整的事做完」。
这也让评测本身成为观察窗口。当考题从局部操作推向端到端业务工作流,榜单分数的含义就变了:它不再只是模型能力的排名,而是模型与工具链耦合深度的排名。
几点需要保留的谨慎
其一,榜单成绩是特定评测口径下的结果。V2 的 321 项任务虽然覆盖面较广,但仍是被设计过的任务集合,与真实企业里格式混乱、来源不一、需要跨系统取数的工作簿存在距离。
其二,「在该榜单取得业界最优」是媒体转述口径,具体到榜单的 Verified 验证流程与提交方式,公开说明有限,独立复核的价值仍在于后续是否有人复现。
其三,评测没有覆盖真实企业场景里的权限边界、数据合规与人工兜底机制。一个能在评测里完整交付工作簿的 Agent,进入企业后仍要面对「它能碰哪些表、改动是否需要审批、出错如何回退」这些问题。
其四,长期积累既是资产也是路径依赖。三十余年的办公软件工程经验是这类产品处理真实文件的优势,但同时也意味着它的能力边界与既有产品形态绑定较深。
其五,评测分数与真实交付之间存在落差。把「能做完」与「做得可靠、可审计、可追责」区分开,比单看一个百分比更有信息量。
该榜单的详细评分细则、产品的第三方独立复现结果以及在企业真实工作流中的稳定性数据,目前官方及行业暂未披露更多细节,后续将持续跟进迭代动态。