给一个已经在生产环境跑着的 AI 智能体做强化学习,过去意味着什么?意味着重构它调用模型的方式,重建工具处理逻辑,把团队调了几个月的上下文管理推倒重来。这笔「入场税」高到绝大多数团队干脆不训练——一直调提示词,直到撞上天花板。
微软这个月开源的 Agent Lightning v1.0,瞄准的就是这笔税。它的承诺相当直白:不改动智能体的一行代码。
一、核心思路:让真实的 Harness 参与训练
Agent Lightning v1.0 由微软亚洲研究院联合复旦大学、浙江大学、爱丁堡大学等团队发布(技术报告 arXiv:2608.17528),采用 MIT 协议开源。
它的做法不是接管智能体的交互循环,而是在智能体与模型端点之间插入一层 API 网关。智能体照旧发起同样的 API 调用,网关负责拦截、记录每一次请求与响应,再把这些数据交给训练器。工具、上下文管理、控制流与执行环境全部留在环内——恰恰是生产逻辑真正所在的地方。
这个范式有个名字:Harnessed Agentic RL。区别在于,标准 agentic RL 中训练引擎拥有环境交互循环,会模拟工具调用、管理状态,本质上是替换掉真实的 agent harness;而在 harnessed agentic RL 中,harness 继续拥有循环,训练器只观察 LLM 请求-响应序列。这一点很关键,因为在模拟环境中训练出来的智能体,迁移到真实环境时往往失效——而 harness 在训练环内,训练的就是与生产一致的行为。
值得注意的是,后续出现的若干框架(verl Uni-Agent、AReaL 2.0、Polar)采用了相同的架构,这算是一个「确实解决了真问题」的旁证。
二、三个组件,约 3500 行代码
v1.0 是一次彻底重写,实现精简到约 3500 行 Python,由三部分组成:
API Gateway——代理智能体的全部 LLM 调用,存储 rollout,透明转发请求,对智能体而言就是一个普通的模型端点。Rollout Controller——把智能体以 Kubernetes Job(或本地进程)方式拉起,每轮训练运行在隔离环境中,这对需要沙箱文件系统与 Shell 的编码智能体尤其重要。Trainer——基于 verl 与 vLLM 构建,收集 rollout 数据、组装训练样本,运行 PPO 或 GRPO 更新策略;也支持 APO(自动提示词优化)作为更便宜的非梯度替代方案。
安装即 pip install agentlightning,要求 Python 3.10 及以上。微软把「简单」当作 v1.0 的第一原则,这个代码量就是证明。
三、成绩:6000 条样本换 14.6 个百分点
官方给出的完整实战示例是:以 Qwen3.5-9B 为基座,配合 SWE-smith 与 mini-SWE-agent,仅用约 6000 条训练样本,SWE-bench Verified 的 Pass@1 从 41.8% 提升到 56.4%,绝对提升 14.6 个百分点。
SWE-bench Verified 考的是智能体能否解决真实 GitHub issue——不是编造的练习题,而是带验证补丁的真实缺陷与功能请求。多数团队把它当作天花板而非变量,因此这个幅度值得认真看待。训练所用的算力被微软描述为「modest compute」,并非只有 GPU 集群才能复现。数据清洗、防止 reward hacking 的方案与训练脚本全部开源。
工程侧还有一项优化:Collocated Async RL,rollout 与模型更新共用同一组 GPU,相比同步 RL 约有 2 倍端到端加速,且比传统异步 RL 更省 GPU。
兼容性方面,官方称已验证 mini-SWE-agent、OpenHands、OpenCode、Claude Code、Codex、LangChain、AutoGen、OpenAI Agents SDK 等框架。随后的 v1.0.1 还推出了 Agent Lightning Skill,让 Claude Code、Codex、GitHub Copilot 等编程智能体能够系统地优化其他 AI 智能体的提示词、工具与工作流。
四、客观看:门槛降了,但没消失
需要先划清边界。
奖励函数仍然是你自己的活。框架提供的是训练基础设施,而定义「什么算好」完全由团队承担。对编码智能体来说,reward hacking 是真实风险——框架提供了完整的 rollout 可见性来帮助排查,但不会替你设计奖励。这一点在 OpenAI 智能体入侵 Hugging Face 事件之后尤其值得警惕:当智能体认为评分器会审查它,它就有动机去操纵评分器看到的东西。
平台支持有限。目前仅支持 Linux(推荐 Ubuntu 22.04 及以上),macOS 与非 WSL2 的 Windows 暂不支持。v1.0 是完整重写,小版本内预计还会有 API 变动。
不是所有团队现在就该上。如果你的智能体还在频繁调整工具与架构,那么先把 agent 本身和奖励信号稳定下来更有价值——没有稳定的智能体和清晰的奖励信号,训练无从谈起。
另外,衡量改进时需要小心口径。微软同期(8 月 19 日)还开源了 ThinkingBox——一个通过校验数据库实际状态变化而非对话转录来验证智能体可靠性的评测框架。在训练前后各跑一次,比只看基准分数更能说明问题。
总的来说,Agent Lightning v1.0 的价值不在于那 14.6 分,而在于它把「给智能体做 RL」从一项架构改造工程,降成了一次接入配置。对已经跑着生产智能体、又明显撞上提示词天花板的团队,这是一个值得排进 sprint 的选项;对还在搭架子的团队,先收藏,等稳定了再看。