9 月 10 日,阿里技术发布 Agent 自进化(Self-Evolution)系统综述,把过去分散的「技能自动提炼、技能迭代、技能与模型共进化」串成一条完整路径。核心信号是:Skill 正从「写死的静态提示」走向「可训练的外部参数」——Agent 不再只是被提示词驱动,而是能自己长出、打磨并复用能力。

完整事件全貌

综述给出四块拼图:Trace2Skill 从执行轨迹中提炼通用技能,把一次成功操作沉淀为可复用资产;EvoSkill / SkillOpt 让技能自动迭代优化,而非人手工调提示词;SkillRL 把强化学习引入技能库,使技能与底层模型权重递归共进化;GiGPO 算法则专门解决长序列、稀疏奖励下的训练难题——这是 Agent 自进化最大的工程拦路虎:一次任务跑几千步,只有末尾成功或失败一个信号,中间几乎没梯度。

核心差异化亮点

与「提示词工程 + 人肉维护技能库」的旧范式相比,这套体系的增量在于把技能变成了「可训练对象」。过去技能库是静态知识,更新靠人;现在技能能根据真实轨迹自我改进,并把改进反哺回模型。这更接近人类团队的「干中学」:做完一个项目,把方法论固化,下次更快。对编程、运维、客服等重复结构强的场景,自进化有望把单次交付成本持续摊薄。

落地短板与局限

现实约束有三:其一,自进化依赖大量高质量执行轨迹,轨迹稀疏或噪声大时,EvoSkill 可能学到错误模式;其二,GiGPO 解决了稀疏奖励,但长程任务的可验证性仍是瓶颈——「任务是否真的做对」本身需要评测体系支撑;其三,技能自动演化带来可解释性与安全隐忧:一个自己改写的技能,出了错难溯源。目前相关评测多为厂商内部口径,公开第三方基准行业暂未完整披露,后续将持续跟进迭代动态。

纵向与横向对比

纵向看,这承接了 Agent 从「单提示」到「多技能编排」再到「技能自进化」的三级跳,呼应 CREAO 等创业公司的递归自迭代 Harness,但阿里把 SkillRL 与共进化机制提到了研究综述层面。横向看,海外 OpenHands、Devin 等更强调「人在回路的编码闭环」,阿里这条线更偏「技能作为可训练外部参数」的模型侧思路,两条路径不互斥,可能走向融合。

中长期趋势研判

若自进化路线跑通,Agent 的竞争单位会从「谁的提示词写得好」转为「谁的技能库进化得快、验证得严」。但这也把治理责任前移:企业需要为「Agent 自己长出的能力」建立评测、回滚与审计机制。短期看,自进化更适合封闭、高频、可验证的垂直工作流;通用开放域的全面自进化,仍处研究阶段。