一句话:OpenAI 刚把「AI 团队」端上货架,o1 的奠基人却说,别被智能体的数量骗了
9 月底的 DevDay 2026 上,OpenAI 把多智能体从研究能力一路推到了产品主线:能全天候工作的 Dots、面向企业的 Specialist Dots、以及把编排与计算机操作开放给开发者的 Agents API。从个人助手、企业虚拟同事到开发者基建,多 Agent 贯穿了整场发布会。但就在同一周,OpenAI 研究员、o1 及后续推理模型的早期奠基者之一 Noam Brown,在一档播客对话里给这股热潮泼了盆冷水:当讨论聚焦「一万个 AI 如何协同解题」时,他先强调的恰恰是底座模型本身的能力——在他看来,多智能体容易获得超出其实际贡献的关注,而真正支撑突破的,是一个足够强的通用模型,以及让它持续运行、并行思考的能力。
「不到 10%」到底在说什么
Brown 举的例子是:用一万个智能体去解一类世界级难题,多智能体这部分带来的贡献,占不到整体的百分之十。这句话容易被误读成「多智能体没用」——但他在访谈里的意思更接近:当基础模型足够强、并且能长时间并行运转时,单纯把智能体数量往上堆,边际收益会快速变薄。换句话说,他质疑的是「数量叙事」,而不是「协作叙事」。一个足够强的单体,配合持续运行和并行思考,往往比一群沟通成本极高的智能体更划算。这个视角对当下动辄宣称「组建智能体军团」的产品话术,是一剂清醒剂。
为什么「多」不等于「强」
从 4 个、16 个到 1 万个 Agent,能力提升并不是线性叠加。决定它们能否成为高效团队的,是几个更朴素的工程问题:它们之间能否有效交流、能否共享上下文而不重复劳动、能否形成清晰分工。如果这些机制缺位,数量越多反而越乱——沟通开销、上下文污染、目标漂移会吃掉本该有的增益。Brown 的判断其实和本站近期关于开源多智能体故障的研究互为印证:真正卡住系统的,常常在「接力棒交接」的地方,而不是任何一个角色够不够聪明。
诚实的地方:实验数据还没跟上叙事
Brown 没有把话说死,反而显出了克制。他坦言,目前还没有充分的实验数据,能准确说明万级规模下的协调效率究竟如何。这也意味着,「多智能体必然更强」更多是一种直觉或营销预期,而非已被反复验证的结论。至于把这种协作用于自我改进,进步可能显著加快,但仍受实验时间和算力的硬约束。对一个正在被加速产品化的方向,这种「先承认不知道」的态度,反而比动辄给出漂亮曲线的演示更可信。
更尖锐的一问:协作更好,就服务人类目标吗
访谈里最值得品味的,是那句追问:智能体之间配合得更好,并不保证它们始终服务于人类的目标。这句话把讨论从「能力」拉到了「对齐」。当越来越多的智能体协作更久、承担更多职责,我们怎么确认它们在变强的同时也变得更值得信任?这恰好和本站近期关于智能体可靠性、评测范式、安全治理的多篇稿件形成对话——产品可以把「AI 团队」做得更顺滑,但「顺滑」不等于「可靠」,更不等于「可控」。
增量认知:多智能体淘金热,需要一次降温
把 Brown 的观点放回当下,它给行业三点提醒。其一,别把资源都押在「堆数量」上,底座模型的持续运行与并行能力、以及高效的协作机制,才是真正可放大的杠杆。其二,评估多智能体系统时,要看端到端任务是否被更好地完成,而不是看它用了多少个 Agent。其三,产品叙事可以热闹,但工程落地要先回答「交流、上下文、分工」这三道题。对正在选型或自建多智能体系统的团队,这盆冷水来得很及时:先把单体的能力与合作协议打磨好,再谈规模。
边界:这是观点,不是定论
需要如实说明,以上主要来自 Brown 个人在一档播客中的访谈表述,属于研究者的判断而非官方结论,也未被大规模独立实验坐实。不同任务下多智能体的贡献占比会有很大差异——有些高度并行的搜索、生成类任务,多 Agent 的增益可能相当可观。把它当作一种「别被数量叙事带跑」的校正视角,比当成「多智能体无用论」更合适。后续值得跟踪的,是有没有团队在受控基准上系统测量「万级协作」的真实效率曲线。
结语
DevDay 把多 Agent 做成了产品,Brown 提醒我们别神话它的数量。真正值得追逐的,从来不是「多少个智能体」,而是「它们是否真的在高效协作、是否真的服务你想达成的目标」。在智能体从演示走向生产的这一年,这种冷思考比任何热词都更稀缺。