高级 📋 6 个步骤 第 334 / 470 篇

Agent 越用越聪明:萨顿质疑「上线即停止学习」后,持续后训练飞轮怎么做

8 月 26 日梳理指出,强化学习之父萨顿质疑 Agent「上线即停止学习」:模型交付后权重冻结,无法从真实任务中持续学习。以 Alloomi 为代表的「持续后训练飞轮」用 LoRA Adapter 与参数化记忆把经验写回能力,但距真正终身学习仍远。本教程讲认知框架与四步飞轮落地。

2026.08.26· 16 分钟阅读· 约 1964 字

你买回来的 Agent,是不是用了一个月还是老样子?强化学习之父理查德·萨顿在 8 月的一次访谈里点破了这个现象——模型交付后权重就冻结了,它无法从你真实任务里持续学习。所谓「越用越聪明」,多数产品其实是靠用户手动调提示词硬撑。但另一条路正在成型:以 Alloomi 等团队为代表的「持续后训练飞轮」——用 LoRA Adapter 与参数化记忆,把运行中的经验写回能力本身。本教程讲清楚这个认知框架,并给出可落地的四步飞轮。

🧠 本教程适合:想理解「Agent 为什么不会自己变强」的产品经理、AI 工程师与技术决策者。偏认知框架与架构设计,代码量少。

先搞懂:萨顿在质疑什么?

萨顿与 Javed 访谈的核心观点很直接:

当前 Agent 的常态问题
模型交付后权重冻结训练时学会的,就是它能力的上限
运行经验只进上下文,不进能力这轮学到的东西,下轮开新会话就忘了
「越用越聪明」靠提示词堆叠人在当免费训练师,模型本身没长进

一句话:多数 Agent 是「会用工具的固定能力体」,不是「会成长的生物」。萨顿认为真正的 Agent 应该把真实任务里的经验沉淀成能力——这正是「持续后训练」要解决的问题。

Step 1:盘点 Agent 的四种「经验形态」

1 经验从薄到厚,能力从弱到强

想理解飞轮,先分清经验可以存成哪四种东西,成本和收益逐级递增:

形态是什么例子成本
日志运行记录,只读这单为什么失败极低
技能可复用的流程封装「生成月报」的步骤模板低
记忆参数化的可读写知识用户偏好、项目事实、领域规则中
权重写进模型参数的能力通过微调让模型更懂你的领域高
💡 大部分团队现在只做到前两层(日志 + 技能)。飞轮的进阶,就是让「记忆」与「权重」这两层也转起来。

Step 2:用 LoRA Adapter 把经验写进权重

2 低成本微调,不碰基座

全量微调太贵,LoRA(低秩适配)是「持续后训练」的主力工具:

LoRA 的思路:
· 冻结基座模型权重
· 只训练一小撮「适配器」(Adapter)参数
· 训练成本 / 显存需求比全量微调低一个量级

持续后训练里的用法:
1. 收集一段时间的高质量任务数据
   (成功案例、纠错样本、用户反馈)
2. 在基座上训练一个「领域 LoRA Adapter」
3. 把这个 Adapter 挂到运行中的 Agent 上
4. 下个周期继续积累数据 → 训练新 Adapter
   → 评估 → 替换旧 Adapter

效果:模型对「你的领域」的理解逐步加深,
而不需要为每次升级重训整个模型。

别把 LoRA 当万能药:Adapter 提升的是「领域适应度」,不是「通用智力」。数据质量差时,微调反而可能让模型变「僵」——所以评估环节绝不能省。

Step 3:用参数化记忆让知识可读写、可淘汰

3 记忆不是聊天记录,是结构化资产

「参数化记忆」是把知识存成 Agent 可查询、可更新、可淘汰的结构,而不是塞在上下文里的一堆对话:

设计要点:
1. 可写入:Agent 完成任务后,把关键结论
   写入记忆库(用户偏好、业务规则、决策背景)
2. 可检索:下次任务自动召回相关记忆,
   不用重新解释一遍背景
3. 可更新:信息过时 → 旧条目被覆盖/降权
4. 可淘汰:长期无用的记忆定期清理,
   避免记忆库腐烂、越存越乱

落地形态参考:
· 个人场景:《MCP 记忆系统》的 Memory 服务
· 团队场景:《Team Memory》按角色装配记忆资产
· 生产级:参数化存储 + 版本管理 + 审计
💡 记忆和技能要分工:「怎么做」进技能,「知道什么」进记忆。把两者混在一起,是记忆系统最常见的翻车原因。

Step 4:把飞轮转起来——采集→筛选→训练→评估

4 一个可运转的闭环
持续后训练飞轮(每周期,如每周/每月):
① 采集:汇总运行日志、用户反馈、纠错记录、
   成功/失败案例
② 筛选:挑出「高质量 + 有代表性」的样本
   ——不是所有经验都值得学
   (低质样本会污染能力,宁缺毋滥)
③ 训练:LoRA 微调 + 记忆库更新
   ——权重与记忆双通道沉淀
④ 评估:用回归基准测试新 Adapter
   ——能力有提升?老能力有没有退化?
   通过 → 上线替换;不通过 → 回滚重来

关键指标:
· 任务成功率环比变化
· 用户纠错率 / 返工率
· 回归基准得分(防退化)

飞轮转错方向就是「恶性循环」:采集垃圾 → 学进垃圾 → 越用越差。所以「筛选」和「评估」这两步的权重,不低于「训练」本身。

Step 5:与现有自改进路线的分工

5 三套「越用越聪明」打配合

目前「让 Agent 变强」有三条主流路线,理解它们的边界才能组合使用:

路线代表改什么周期
Harness 自改进PenguinHarness / Prime Agent改造工具链:技能、子代理、编排实时/近实时
强化学习训练Agent Lightning用 RL 教模型在「真实 harness」里做得更好周/月级
持续后训练飞轮Alloomi 等(本教程)LoRA + 参数化记忆,把运行经验写回能力周/月级
💡 三者不是二选一:harness 层解决「当下表现」,后训练解决「长期成长」,RL 是两者的放大器。成熟团队通常先跑 harness 自改进,再叠加持续后训练。

Step 6:从认知到落地——你的路线图

6 先跑通小飞轮,再谈终身学习
第一档(1-2 周):经验先「存下来」
· 给 Agent 加结构化日志,记录每次成败
· 建立简单反馈入口(用户点赞/纠错)
→ 目标:有数据可复盘

第二档(1-2 个月):经验变成「技能与记忆」
· 高频成功路径封装成技能
· 上线参数化记忆,让 Agent 记住你的偏好
→ 目标:新会话不用重新教

第三档(3-6 个月):技能沉淀进「权重」
· 用 LoRA 训练领域 Adapter
· 建立回归基准,安全上线
→ 目标:模型真的变「懂你」

第四档(持续):全飞轮运转 + 评估自动化
→ 目标:每周期自动「采集-筛选-训练-评估」,
   Agent 的能力曲线持续向上

记住萨顿的提醒:真正终身学习还很远,
但「把运行经验写回能力」的飞轮,
今天就能在你自己系统里转起来。
🎉 至此你已掌握持续后训练飞轮的完整框架:四种经验形态 → LoRA 写权重 → 参数化记忆 → 四步闭环 → 与现有路线分工 → 分档落地。Agent 不会一夜之间「长大成人」,但每个周期都在变强,本身就是质变。

常见问题速查

你遇到的现象大概率原因 & 解决
微调后反而变笨了训练数据质量差或评估缺失;先建回归基准,再小步迭代
记忆库越用越乱缺淘汰机制;给记忆加时间戳、来源与优先级,定期清理
不知道哪些经验值得学从「高频 + 高价值 + 高确定性」的任务开始沉淀,别贪多
团队没人懂微调先做前两档(日志/技能/记忆),权重层可以外包或用托管服务
← 返回教程中心