← 返回首页
🧱

Lego-RL

华为 × 香港中文大学(LegoX 系列)

不改一行 harness 代码就能给 Coding Agent 接强化学习

开源 大厂 训练框架 强化学习
B+
Coding Agent 强化学习训练框架
⭐⭐⭐⭐

📖 产品简介

Lego-RL 是华为与香港中文大学联合团队(LegoX 系列)于 2026 年 8 月底开源的、面向 Coding Agent 的强化学习训练框架(论文 arXiv:2608.17393)。

它要解决的是 Agentic RL 里三个长期存在的工程痛点,对应三条设计主线。Faithful(保真优化):Agent harness 在运行时会不断改写自己的对话历史(Claude Code 会插入摘要、OpenHands 会做 history compaction、工具调用参数会被重新序列化、子代理与父代理共用 session),因此「存档的 transcript」并不等于「采样当时的 token 序列」,直接重算得到的重要性采样比率是错的。Lego-RL 在推理服务边界放一个进程内 proxy(同时提供 OpenAI 与 Anthropic 两套接口),在生成时就地记录 token id、response mask、logprob 与 MoE 专家路由,并做 message 粒度的上下文对齐与 MoE 路由 replay。Reliable(可靠执行):把「问题描述 + 仓库快照 + 可执行 verifier」封装成统一任务格式,放进 Harbor 沙箱逐 trial 执行(生产用 Kubernetes 一轨迹一 pod,小规模用 Docker),reward 由真实代码执行给出;反作弊与分阶段网络策略做在沙箱侧而非 harness 侧,并按难度筛选任务池、按终止原因决定是否计入 loss、支持全异步调度。Observable(可观测训练):Agent Plugin 在启动前校验配置与资源,Live UI 提供轨迹级诊断,避免把「策略退化」和「镜像仓库故障」混为一谈。架构上,Trainer 构建在 verl 之上(FSDP / Megatron-LM / VeOmni 后端,PPO / GRPO / GSPO 目标,vLLM rollout 池),沙箱构建在 Harbor 之上;接一个新 harness 只需实现轻量 Adapter,轨迹捕获、负载均衡与 R3 路由回放会自动继承。实测基于 Qwen3.5-35B-A3B、2,699 条任务、200k 上下文、各训 3 个 epoch(126 step),SWE-bench Verified 从 64.0 / 62.4 / 57.2 提升到 70.4 / 68.2 / 66.6(OpenHands SDK / Claude Code / OpenCode),收益超过直接换一代 base 模型(Qwen3.6-35B-A3B 换代仅带来 3.4 / 1.0 / 3.4 分)。异步调度下同样 7.5 小时完成 7 步对比同步 3 步,校正算力差异后单步时间 1.9 小时对 1.0 小时。

定位
不改一行 harness 代码就能给 Coding Agent 接强化学习
适合人群
自研编码智能体、需要 RL 数据飞轮的模型团队 已有 OpenHands / Claude Code / OpenCode 执行环境、想接强化学习的团队 研究 harness 对 Agent 策略影响的高校与研究机构 希望复用现成 harness 而不自研整套执行环境的工程团队
支持平台
Linux、Kubernetes / Docker 沙箱、Python
开源
是 · GitHub

核心功能

  • 🔬 Faithful 保真优化:进程内 proxy 在推理边界就地记录 token id / logprob / response mask 与 MoE 路由并支持 replay
  • 📦 零改动接入:无需修改 OpenHands SDK、Claude Code、OpenCode 任一 harness 的源码
  • 🛡️ Reliable 可靠执行:Harbor 沙箱 + 可执行 verifier 出 0/1 reward,反作弊与网络策略做在沙箱侧
  • 📊 Observable 可观测:Agent Plugin 启动前校验 + Live UI 轨迹级诊断,区分策略退化与 Infra 故障
  • 全异步调度:单步耗时较同步方案接近减半(校正后 1.9h → 1.0h),缓解长尾任务空转
  • 🧩 可插拔 Adapter:任一能说 OpenAI / Anthropic 协议的 harness,实现 adapter 即可继承全部链路能力

⚖️ 优缺点分析

👍 优点

  • 不用为每个 harness 重写一套环境适配,训练框架与 Agent 框架解耦
  • 在推理边界截取真实生成数据,解决了 transcript 重算导致 RL 目标失真的问题
  • 三个主流 harness 上端到端验证,收益可超过换一代 base 模型
  • 开放论文、代码、模型权重与 2,699 条任务数据,可复现

👎 缺点

  • 面向训练侧而非终端用户,需要 GPU 集群与 RL 工程能力才能跑起来
  • 当前端到端验证仅覆盖 OpenHands SDK / Claude Code / OpenCode 三个 harness
  • 性能收益依赖任务池与当前策略能力匹配,组内 reward 全同则不贡献梯度
  • 刚开源,社区生态与最佳实践仍在积累阶段

📊 评分详情

功能完整
8.5
易用程度
6
安全可靠
7.5
性价比
8.5

💬 用户评价

同一份权重换个 harness 就能差近 7 分,这说明 harness 属于环境而不是策略——既然如此,训练就必须发生在你真正部署的那套 harness 上,Lego-RL 把这件事变成了可插拔层。

📝 更新日志

  • 2026-08-29
    开源首发
    **华为联合香港中文大学开源 Lego-RL(Aug 29–30)**——面向 Coding Agent 的强化学习训练框架,LegoX 系列最新工作,论文 arXiv:2608.17393,代码 github.com/LegoX/Lego-RL,文档 lego-rl.pages.dev,模型与 2,699 条任务数据在 Hugging Face 同步开放。核心卖点是无需修改 OpenHands SDK、Claude Code、OpenCode 任一 harness 即可接入 RL:进程内 proxy(同时提供 OpenAI 与 Anthropic 接口)在生成时就地记录 token id / logprob / response mask / MoE 路由并支持 replay,解决 harness 运行时改写历史导致的保真问题;Harbor 沙箱逐 trial 执行并用可执行 verifier 出 0/1 reward,反作弊与网络策略做在沙箱侧;Agent Plugin 启动前校验、Live UI 提供轨迹级诊断。Trainer 基于 verl(FSDP / Megatron-LM / VeOmni,PPO / GRPO / GSPO),沙箱基于 Harbor。实测 Qwen3.5-35B-A3B 在 SWE-bench Verified 上由 64.0 / 62.4 / 57.2 提升至 70.4 / 68.2 / 66.6(OpenHands SDK / Claude Code / OpenCode),超过 Qwen3.6 换代带来的 3.4 / 1.0 / 3.4 分增益;全异步调度下单步耗时由 1.9 小时降至 1.0 小时。