10 月 1 日,VentureBeat 报道了 Google Research 与弗吉尼亚理工联合提出的 WikiSkill 框架:它给智能体建一本「失败维基」,把每次执行留下的轨迹编译成持久知识,让技能演化不再每轮推倒重来。灵感来自 Andrej Karpathy 早前提的 LLM Wiki 设想——把经验沉淀成不可变源、可维护维基与索引日志。对长期跑智能体的团队来说,这戳中了一个很实在的痛点:很多自改进框架修完一个错,却把「为什么错、哪个修复被拒」一起丢掉了,于是同一道坎反复栽。
背景:技能会演化,但诊断常被丢掉
智能体技能把某类任务的指令、脚本与工作流打包成可复用模块,让 agent 不必改模型权重就获得专项能力。但手工写技能要求开发者提前猜中 agent 会遇到的所有边界。近来的技能演化框架改让 agent 在训练任务上跑、分析成败轨迹、据经验生成技能更新。问题出在:很多框架里,优化器读完轨迹、提了补丁,就把诊断连同「哪个修复没过验证」一起丢弃。论文合作者、Google 研究科学家 Liyan Tang 点破:系统于是不断重新发现同样的失败、反复重提被拒的修复。WikiSkill 要做的,是给那些诊断与被拒提案一个持久的家。
三层工作区:原始、维基、技能各司其职
WikiSkill 把智能体工作区分成三层。Raw 层只写不改地存全部执行轨迹:推理、工具调用、工具输出与最终答案,作为不可篡改的历史。Wiki 层把轨迹提炼成结构化知识,既有反复出现的失败模式页,也有记录每次技能提案是否被采纳的演化日志与影响追踪。Skill 层只放生产真正执行的精简技能文件,每个技能都链回促成它的维基模式。关键在中间这层永不回滚:哪怕一次技能更新失败,维基里积累的认知仍然保留,后续迭代得以站在已有历史上,而不是从头再来。
四步循环:验证不过的改动,一律不进生产
每个演化周期由四个角色协同。Inference Agent 用当前技能跑训练任务、写新轨迹;Wiki Maintainer 采样成败轨迹、更新模式页与日志;Skill Proposer 读维基与部分轨迹、提议新建或修补;最后在验证集上评估,只有把最佳分数往上推的改动才保留。Skill Proposer 用 ReAct 循环,论文里每轮约 10 到 20 步,边翻维基页边看轨迹。一个 ALFWorld household 环境的案例很说明问题:首轮发现 agent 反复「拿起—查看—放回」,提议的宽泛技能被验证拒掉,维基留住行为与提案;第二轮改成具体的「别把东西放回原处」规则,通过验证被采纳;后来同类循环模式出现,系统是在同一技能上精炼规则,而非另起炉灶。
为什么值得写:好笔记,能追平更大模型
研究者在数学推理、网页搜索、电子表格、长文档问答与交互式家务五类基准上对比 WikiSkill 与 Trace2Skill、EvoSkill、SkillOpt 及无技能基线,测试 Qwen、Gemma、Gemini 系列,报告每个模型都拿到最高均值。更耐人寻味的是跨尺度与跨模型:Qwen 家族相对无技能的增益随参数放大,从 4B 约 12 个百分点到 27B 约 24 个百分点;在大模型上演化出的技能还能迁移给小模型。换句话说,一个更会记笔记的小模型,有机会逼近一个不记笔记的大模型——这对企业用便宜模型跑生产的成本账是个实打实的提示。
边界:长程与膨胀是下一道坎
需要清醒看待的是,论文本身也指出后续挑战:任务越长,维基越容易膨胀,自动修剪与动态检索会成必答题;在线技能适配(让 agent 在数小时工作流中途就地精炼指令)是下一站。文中没有承诺代码开不开源,增益数字也来自作者自报与第三方转述,落到具体业务负载仍需自建验证集复核。但对任何已经在跑多步 agent 的团队,WikiSkill 的核心动作并不需要等论文代码:留存全量轨迹、每周复盘失败、把每条规则写成「发生了什么、为什么、怎么修」的短页、每次改动拿上月失败集测过再上线、旧版本留着可回滚——这套习惯本身就能让修复真正沉淀下来。
结语
WikiSkill 给行业的提示,不在于又提出一个记忆结构,而在于它把「失败诊断」从一次性消耗品变成可复利资产。当智能体的竞争力越来越取决于「踩过的坑下次还记不记得」,谁能把经验编译成持久、可审计、能回滚的维基,谁就更接近一个会越用越聪明的 agent。