多智能体系统的老毛病,做过工程的人都知道:智能体一多,中间那个负责派活的编排器先累垮。任务分派、进度协调、结果汇总,全从它一个口过——它就是整个系统的吞吐上限,也是单点故障的最佳候选。9 月 22 日提交 arXiv 的论文 Agensh 换了条路:把编排器整个拆掉,让智能体们在一片共享工地上自己找活干,一路把组织规模推到了 1024 个并发工作者。

论文作者为 Zhihao Zhan、Ting Song、Li Dong、Shaohan Huang、Jianxun Lian、Yan Xia 与 Furu Wei。结构上,Agensh 用三件套替代中央编排:共享工作区挂着待办、进行中、已完成三态的任务,消息接口让工作者互相通气,共享上下文沉淀可复用的发现与工作意图。每个工作者循环执行同一套动作——收集上下文、认领子任务、动手干活、分享发现、验证结果、合并进度——全程异步,谁也不用等谁。所谓组织智能,不在某个聪明的调度者脑子里,而在工地本身的布置里。

左:中央编排器成为吞吐瓶颈;右:Agensh 的三件套组织基建中央编排器分配任务、协调进度工作者等待派工工作者等待派工所有协调流量都过中心共享工作区 Workspace待办 / 进行中 / 已完成三态消息接口 Message工作者之间异步通信共享上下文 Context可复用发现 + 工作意图工作者自领子任务工作者自领子任务工作者自领子任务没有老板,只有工地:协调职责拆进三件套
图 1|两种多智能体组织结构:去掉中央编排器后,协调职责被拆进工作区、消息与共享上下文三件套

成绩单用 GPT-5.6-sol(high)在 ProgramBench 最难的五道编程题上跑出来。规模从 1 个智能体扩到 128 个,平均最终测试通过率从 19.31% 涨到 28.78%,相对提升约 49%;更大的组织还能更早达到同等通过率——人多不只结果好,到账也快。最扎眼的数据在 pandoc 任务上:从 1 个扩到 1024 个智能体,通过率从 33.89% 抬到 55.06%。轨迹分析还显示,随着组织变大,自组织协作的形态会逐渐涌现并标准化——智能体们自己长出了分工惯例,而且越干越像样。

GPT-5.6-sol(high),ProgramBench 最难五题(论文口径)平均通过率:1 个对比 128 个智能体1 个智能体19.31%128 个智能体28.78%相对提升约 49%pandoc 任务:1 个对比 1024 个智能体1 个智能体33.89%1024 个智能体55.06%更大组织更早达标
图 2|两条规模曲线:智能体数量增加,通过率与达标速度同步抬升

这篇论文真正想立论的,是把「智能体数量」变成一个新的扩展维度。过去两年,行业的扩展叙事都围着参数、数据、算力、测试时计算打转,个体智能体的能力边界被反复推挤;Agensh 提供的是另一个方向的证据——在任务可分解、时间预算硬的前提下,横向堆组织规模也能把前沿往外推一段。它与此前的几条多智能体线各有分工:Nous Hermes 的百万行重构证明了大规模智能体编队在真实工程里的产出,测试时通信研究证明了共享目录式的松协作在难题上优于各自独立作答,而 Agensh 补的是组织基建这一层——怎么让上千个工作者不打架、不空转、不互相踩脚。

与主流框架的对照能帮着看清取舍。LangGraph 这类编排框架把控制流显式写进图结构,开发者画好状态机,智能体照着走——确定性强、可调试,但图的复杂度随任务类型膨胀;CrewAI 式的角色分工把组织结构前置,谁干什么在设计时就定了;Agensh 则把结构交给运行时去长,换来的是任务形态变化时不用重写编排逻辑。三者不是替代关系:流程稳定的产线任务,显式编排仍然省心;开放、可分解、时间紧的任务,自组织才开始显出优势。论文里「更大组织更早达标」这个细节尤其值得注意——传统人力组织里,人越多协调开销越大,边际收益递减;在这里组织规模反而换来了更快的收敛速度,协调成本被异步化、被摊薄到了共享基建里。

当然,边界也要看清。实验全在编程任务上,pandoc 是个高度可分解的重构型工作,换成强耦合、需紧协调的任务,无编排器的路线未必还占优;千级并发背后的推理开销、失败工作者对共享上下文的污染、以及「协作惯例涌现」的稳定性,论文给了现象级证据但没给长期保证;此外实验依赖 GPT-5.6-sol(high)单一模型档位,跨模型稳健性尚未验证。1024 个智能体的工地目前更像一个方向证明,而不是一套可以照抄的生产方案——但「去掉中间商」这个组织设计直觉,值得每个做多智能体系统的人掂量一下:你的编排器,到底在解决协调问题,还是在制造瓶颈。