10 月 1 日提交的论文 Right Answers, Wrong States: Hidden Information Failures in Multi-Agent Collaboration(arXiv 2610.01244)问了一个被多数协作评测忽略的问题:多智能体系统常常只看「最后答对了没有」,却漏掉了协作过程有没有在共享信息里留下被污染的状态。论文把这种「当下决策没错、却被污染的信息状态在后面捅娄子」的现象称为 off-query failure(脱靶式失效),并在医疗与灾害响应两类高危场景里做了量化。
背景:评测只看答案,等于闭上一只眼
让多个智能体分工解一道题,业界的习惯是看最终答案对不对。但这篇论文指出,协作的质量不能只看终点。一个 agent 可能在这一步给出了正确决策,却把一条已经被污染的事实写进了共享状态;当下任务不依赖这条事实,于是没人发现,等到后面的任务需要它,错误才爆发。论文用 OffQuery 把协作拆成三件独立的事分别打分:T1 证据核验(用过的事实准不准)、T2 共享状态重建(留下来的是否可信)、T3 任务解决(这次决策对不对)。
实验:任务答得不错,状态却很糟
在 GPT、Gemini、Qwen 等模型上,标准协作的任务解决率平均到了 64.7,看起来不差;可同一批实验里,证据核验只有 14.3、共享状态重建只有 43.1。差距大到刺眼——系统很会给出当步答案,却几乎不擅长保证用过的事实与留下的状态可信。论文把根因归结为「选择性使用信息」:当下的查询常常绕过那些被污染的事实,而绕过一时爽,等到后续任务真的要用它们,才酿成脱靶式失效。这意味着,只看准确率会严重高估多智能体协作的可靠程度。
修复:把被绕开的事实重新对齐
针对这个盲区,论文提出 ReGround:先消解彼此冲突的证据、核验共享事实、重建一份可信状态,再基于这份状态推理。在跨七个模型、三个系列的测试里,ReGround 在每一类场景、每一项能力上都带来提升,相对增益平均达到 T1 约 309、T2 约 82.9、T3 约 17.6。换句话说,先把「共享状态」这件事做对,比急着把当步答案答得更漂亮,更能抬升协作的整体可靠度。
为什么值得写:可靠协作的两道关
把这篇和近期多智能体协作的研究对照,它的增量认知很实用:多数框架把注意力放在「群体能不能答得更好」,而这篇提醒我们,协作还有另一道关——留下的状态值不值得信。对正在拿多智能体做决策支持、尤其是医疗与应急这类一步错就代价高的场景,OffQuery 给出的清单是:评测时别只盯任务准确率,要把证据核验与状态重建也纳进来;部署时给共享状态加一层校验与重建,而不是默认可信。
边界:实验室信号,不是生产定论
需要说明,实验集中在两类受控高危场景、模型与任务都经过筛选,不能直接搬成「生产里多智能体必然留毒状态」的结论。论文本身也在探索如何让协作既高效又可靠,而非全盘否定现有做法。更稳妥的读法,是把它当作一张提醒清单:开启多智能体协作前,先想清楚你验的是答案,还是答案之外那份会被后续任务依赖的状态。
结语
Right Answers, Wrong States 这盆冷水,浇的不是多智能体协作本身,而是「答对就够了」的评测惯性。当智能体开始一起做决策,真正的可靠不只在当下那一步答得对,更在它们留给彼此的状态干不干净。