📖 产品简介
Lego-RL 是华为与香港中文大学联合团队(LegoX 系列)于 2026 年 8 月底开源的、面向 Coding Agent 的强化学习训练框架(论文 arXiv:2608.17393)。
它要解决的是 Agentic RL 里三个长期存在的工程痛点,对应三条设计主线。Faithful(保真优化):Agent harness 在运行时会不断改写自己的对话历史(Claude Code 会插入摘要、OpenHands 会做 history compaction、工具调用参数会被重新序列化、子代理与父代理共用 session),因此「存档的 transcript」并不等于「采样当时的 token 序列」,直接重算得到的重要性采样比率是错的。Lego-RL 在推理服务边界放一个进程内 proxy(同时提供 OpenAI 与 Anthropic 两套接口),在生成时就地记录 token id、response mask、logprob 与 MoE 专家路由,并做 message 粒度的上下文对齐与 MoE 路由 replay。Reliable(可靠执行):把「问题描述 + 仓库快照 + 可执行 verifier」封装成统一任务格式,放进 Harbor 沙箱逐 trial 执行(生产用 Kubernetes 一轨迹一 pod,小规模用 Docker),reward 由真实代码执行给出;反作弊与分阶段网络策略做在沙箱侧而非 harness 侧,并按难度筛选任务池、按终止原因决定是否计入 loss、支持全异步调度。Observable(可观测训练):Agent Plugin 在启动前校验配置与资源,Live UI 提供轨迹级诊断,避免把「策略退化」和「镜像仓库故障」混为一谈。架构上,Trainer 构建在 verl 之上(FSDP / Megatron-LM / VeOmni 后端,PPO / GRPO / GSPO 目标,vLLM rollout 池),沙箱构建在 Harbor 之上;接一个新 harness 只需实现轻量 Adapter,轨迹捕获、负载均衡与 R3 路由回放会自动继承。实测基于 Qwen3.5-35B-A3B、2,699 条任务、200k 上下文、各训 3 个 epoch(126 step),SWE-bench Verified 从 64.0 / 62.4 / 57.2 提升到 70.4 / 68.2 / 66.6(OpenHands SDK / Claude Code / OpenCode),收益超过直接换一代 base 模型(Qwen3.6-35B-A3B 换代仅带来 3.4 / 1.0 / 3.4 分)。异步调度下同样 7.5 小时完成 7 步对比同步 3 步,校正算力差异后单步时间 1.9 小时对 1.0 小时。
✨ 核心功能
- Faithful 保真优化:进程内 proxy 在推理边界就地记录 token id / logprob / response mask 与 MoE 路由并支持 replay
- 零改动接入:无需修改 OpenHands SDK、Claude Code、OpenCode 任一 harness 的源码
- Reliable 可靠执行:Harbor 沙箱 + 可执行 verifier 出 0/1 reward,反作弊与网络策略做在沙箱侧
- Observable 可观测:Agent Plugin 启动前校验 + Live UI 轨迹级诊断,区分策略退化与 Infra 故障
- 全异步调度:单步耗时较同步方案接近减半(校正后 1.9h → 1.0h),缓解长尾任务空转
- 可插拔 Adapter:任一能说 OpenAI / Anthropic 协议的 harness,实现 adapter 即可继承全部链路能力
⚖️ 优缺点分析
👍 优点
- 不用为每个 harness 重写一套环境适配,训练框架与 Agent 框架解耦
- 在推理边界截取真实生成数据,解决了 transcript 重算导致 RL 目标失真的问题
- 三个主流 harness 上端到端验证,收益可超过换一代 base 模型
- 开放论文、代码、模型权重与 2,699 条任务数据,可复现
👎 缺点
- 面向训练侧而非终端用户,需要 GPU 集群与 RL 工程能力才能跑起来
- 当前端到端验证仅覆盖 OpenHands SDK / Claude Code / OpenCode 三个 harness
- 性能收益依赖任务池与当前策略能力匹配,组内 reward 全同则不贡献梯度
- 刚开源,社区生态与最佳实践仍在积累阶段
📊 评分详情
💬 用户评价
📝 更新日志
-
2026-08-29开源首发**华为联合香港中文大学开源 Lego-RL(Aug 29–30)**——面向 Coding Agent 的强化学习训练框架,LegoX 系列最新工作,论文 arXiv:2608.17393,代码 github.com/LegoX/Lego-RL,文档 lego-rl.pages.dev,模型与 2,699 条任务数据在 Hugging Face 同步开放。核心卖点是无需修改 OpenHands SDK、Claude Code、OpenCode 任一 harness 即可接入 RL:进程内 proxy(同时提供 OpenAI 与 Anthropic 接口)在生成时就地记录 token id / logprob / response mask / MoE 路由并支持 replay,解决 harness 运行时改写历史导致的保真问题;Harbor 沙箱逐 trial 执行并用可执行 verifier 出 0/1 reward,反作弊与网络策略做在沙箱侧;Agent Plugin 启动前校验、Live UI 提供轨迹级诊断。Trainer 基于 verl(FSDP / Megatron-LM / VeOmni,PPO / GRPO / GSPO),沙箱基于 Harbor。实测 Qwen3.5-35B-A3B 在 SWE-bench Verified 上由 64.0 / 62.4 / 57.2 提升至 70.4 / 68.2 / 66.6(OpenHands SDK / Claude Code / OpenCode),超过 Qwen3.6 换代带来的 3.4 / 1.0 / 3.4 分增益;全异步调度下单步耗时由 1.9 小时降至 1.0 小时。