问题出在「记忆流」这种结构上

2026 年 9 月 9 日,研究者 Yuxing Lu、Yicheng Chen 与 Shanchan Wu 在 arXiv 提交论文(编号 2609.08593),提出一种名为过程图的执行结构。论文针对的是当前智能体框架里一个被普遍接受的默认设计:把思考、观察与动作按时间顺序追加进上下文,再让模型从这段记录里决定下一步。

这种做法在简单任务上够用,但论文指出它在复杂度上升后会出现几类典型退化:智能体在长交互中偏离原始目标;工具调用顺序出错;重复执行已经失败过的动作;以及在没有全局计划的情况下逐步推进。这些现象在工程实践里并不陌生,它们通常被归因于上下文管理,但论文的处理方式不同——它把问题定义为结构缺失。

把操作知识按知识图谱的方式组织

过程图的核心思路,是用组织事实的方式组织怎么做:把流程写成一张有向图。

图中的节点代表过程步骤,每个节点携带三类信息——步骤描述、期望的输入与输出、以及成功与失败的判定条件。边用来表达步骤之间的关系,包括顺序、条件与并行三种。节点上还挂有属性,例如执行概率、平均耗时、成功率与反复出现的错误模式。

论文用订机票这类任务做了示意:搜索航班、筛选低价选项、检查余座、填写乘机人信息、选择支付方式、确认订单。当余座不足时,流程回到筛选步骤;当没有航班满足条件时,分支到邻近机场。这些分支、循环与条件判断,替代了原本平铺在线性记录里的推理过程。

这个设计的直接收益是可读性:要理解智能体为什么这样行动,可以去看图的节点与边,而不必从一段长篇上下文里反推。

结构如何自我修改

过程图的关键机制是自演化,它以循环方式运行。

智能体先记录完整的执行轨迹,然后把失败的运行与成功的运行做对比,定位两者出现分歧的位置。接下来由一个被论文称为 Refiner 的模型组件提出修改建议,这些建议会在验证集上被检查,只有确实带来改善的才会被保留。

修改分为三类。一类是拓扑变化,例如增加或删除节点与边;一类是属性变化,例如更新统计量、阈值与执行概率;一类是内容变化,例如重写步骤描述与指导语。三类修改对应三种不同层次的修正——结构调整、参数调整与表述调整。

论文测试了三种起点。空图起步演化较慢,但最终能接近其他方案的性能;由人工绘制的最小骨架起步,演化速度快且最终表现较好;而一个存在缺陷的专家设计图,也能被同一套演化循环修复。这一点值得注意,因为它说明机制并不依赖一个完全正确的初始设计。

报告的结果与两个值得关注的发现

在 WebShop 这一电商购物基准上,论文报告过程图相比纯记忆基线取得 15% 至 25% 的成功率提升,演化后的图相比其自身初始版本提升 10% 至 20%。论文还在 ALFWorld(模拟家庭环境中的家务任务)、HotPotQA(多跳问答)以及多 API 工具调用任务上做了评估,并认为图结构有助于保持工具调用顺序与参数设置的正确性。

两个发现对工程实践更有参考价值。一个是跨模型迁移:在 GPT-4 上演化出的图,据报告可以迁移到 Claude 或 Llama 上继续使用。如果这一点成立,意味着图捕获的是任务本身的结构,而不是某个模型的特有习惯,这对担心模型锁定的团队有意义。

另一个是低数据表现:论文称该方法在少于十个示例的情况下仍然有效,而基于记忆的基线在低数据条件下表现急剧下降。

论文给自己的定位:神经符号

论文把这项工作定位为神经符号方向——由大模型提供语义理解,由图提供显式的过程约束。这个组合被类比为快速直觉的系统与缓慢规则的控制器之间的配对。

这个定位解释了它想走的位置:既不接受手工编写刚性工作流(在未预料的情况下容易失效),也不接受让智能体完全从原始记忆里即兴发挥。中间道路是一张由人给出粗略起点、由执行轨迹逐步精修的图。

中立思辨

需要辩证看待几件事。其一,本文引用的具体数值来自对该论文的二手整理,不同来源在措辞上存在差异,工程团队在据此调整架构之前,应当直接查阅 arXiv 原文核对实验设置。其二,WebShop 与 ALFWorld 属于受控基准,任务边界清晰、可重复执行,而真实业务流程中的异常类型更分散,图结构在开放环境下的稳定性尚未被充分检验。其三,自演化机制引入了一个新的验证环节:Refiner 提出的修改需要在验证集上通过才被保留,这意味着验证集的质量直接决定演化方向,如果验证集与真实分布偏离,结构可能朝错误方向优化。其四,论文报告的图能跨模型迁移,但未说明迁移后是否需要重新微调属性阈值,这一步的成本在工程上不可忽略。其五,把流程显式化为图,在提升可读性的同时也提高了维护面:节点、边与属性的数量会随任务复杂度增长,长期运行后如何避免图本身膨胀,是论文未展开的问题。其六,该方法的收益依赖于任务具有可复用的过程结构,对于高度依赖即时判断、过程难以固化的任务,图结构的价值可能有限。论文的完整实验配置与代码细节,目前公开信息有限,后续将持续跟进迭代动态。

趋势研判

短期看,过程图这类结构更可能在流程相对稳定、失败可归因的场景里先被验证,例如客服工单处理、数据核对与多步骤表单填报;中期看,关键变量是它与现有可观测性工具的对接——如果执行轨迹、失败对比与图编辑都能进入同一套日志体系,那么结构演化才可能成为持续运行的机制,而不是一次性的调优动作;长期看,智能体能力的差异可能越来越不体现在提示词上,而体现在有没有一张从自己失败里长出来的图。

对正在搭建智能体系统的团队,一个低成本的起点是先把一条高频失败的流程画出来:列出步骤、标出分支、记下每步的成功率。哪怕不做自动演化,这张图本身也往往能暴露出上下文记录里看不见的结构问题。