进阶 📋 6 个步骤 第 291 / 470 篇

ClawGym II 黑盒强化学习:不用改一行代码,把现成 Agent 工具训练得更聪明

8-18 人大高瓴与至知创新研究院发布 ClawGym II,把 Claude Code、OpenClaw 等现成 Agent 工具直接接进强化学习循环,无需改动内部实现,以 Qwen3-30B 为骨干在 PinchBench 上提升 17.28 分。本教程讲清黑盒 RL 原理、奖励设计、训练评估与部署回用的完整流程。

2026.08.19· 15 分钟阅读· 约 1654 字· 🔬 ClawGym II

8 月 18 日,中国人民大学高瓴人工智能学院与至知创新研究院联合提出 ClawGym II——一个面向复杂 Agent Harness 的黑盒强化学习框架。它最特别的一点是:不需要改动 Claude Code、OpenClaw 等现成 Agent 工具的任何内部实现,直接把它们的「真实执行过程」当作强化学习环境来训练,以 Qwen3-30B 为骨干模型,在 PinchBench 基准上提升了 17.28 分。

🧩 本教程适合:已经会用 Claude Code / OpenClaw 跑任务的开发者,想进一步「调教」Agent 行为的技术爱好者。你将理解黑盒 RL 的核心思路、奖励设计方法、训练评估流程,以及如何把训练成果带回日常使用。

先搞懂:Agent 也能「训练」?黑盒 RL 是什么

平时我们说的「调 Agent」,多半是改提示词、换模型、调参数——这是使用层的优化。而 ClawGym II 做的事情是训练层的优化:把 Agent 当作一个可学习的策略,通过强化学习(RL)让它自己在任务中「学到」更好的行为,比如更会规划、更会选工具、更会收敛在关键步骤上。

对比项传统微调(SFT)黑盒 RL(ClawGym II)
能否改模型权重需要,成本高不需要,完全黑盒
能否改工具代码看情况不需要,开箱即用
优化什么模型参数Agent 的执行策略与行为
对现成工具(Claude Code 等)无能为力直接可用

「黑盒」不等于「玄学」:ClawGym II 通过观察 Agent 的输入输出(行动序列与结果)来更新一个外部策略,全程不碰工具内部实现。它要求你有清晰的奖励信号——奖励怎么设计,直接决定训练出什么「性格」的 Agent。

Step 1:理解 ClawGym II 的定位与适用场景

1 先想清楚:你要「训练」什么
1. 输入:一个现成的 Agent Harness(Claude Code / OpenClaw / 自建)
2. 骨干模型:论文用 Qwen3-30B,你可换成任意可调用的模型
3. 交互方式:Agent 每轮输出行动 → 环境执行 → 返回结果与奖励
4. 产出:训练好的外部策略,指导 Agent 更好地完成任务

适合的场景:
· 固定任务域(客服、代码修复、资料整理)想越用越顺
· 团队想让 Agent 学会「少犯错、少烧 Token」
· 想复现论文思路做实验(PinchBench / SWE-bench 类任务)
💡 若你还没接触过「Agent 自进化」思路,建议先看本中心《Prime Agent:把上下文当变量,跨会话续跑还能自我进化》建立背景。

Step 2:准备训练环境与骨干模型

2 搭出「环境 + Agent + 奖励」三角
1. 环境层:准备带 Docker / 沙箱的机器,跑真实任务
2. Agent 层:装好 Claude Code 或 OpenClaw,配好工具权限
3. 模型层:选择骨干模型(Qwen3-30B 或你已有的 API)
4. 接口层:把 Agent 的「行动-结果」串成 RL 可消费的轨迹
5. 数据层:准备训练任务集(从 PinchBench / 业务题库中抽取)

最小验证:先跑通 1 个任务的完整轨迹,再扩规模

注意资源消耗:RL 训练要反复执行真实任务,比普通推理贵得多。建议先用 10-20 个任务小规模验证奖励设计是否合理,再放大,避免预算失控。成本精算可参考《Agent 经济学》。

Step 3:设计奖励信号

3 奖励决定 Agent 的「价值观」
奖励三要素(按重要度排序):

1. 任务成功率(+1.0):最终结果是否正确 / 通过测试
2. 过程效率(+0.2):步数越少、Token 越省,奖励越高
3. 安全约束(-0.5):触碰禁区(删库、发外网、越权)重罚

示例评分公式:
score = 完成奖励 × 0.6 + 效率奖励 × 0.25 + 安全惩罚 × 0.15
🔑 奖励别只盯「成功」:效率与安全必须进奖励。否则训练出的 Agent 会像「很努力但很费钱」的员工——事做成了,账单吓人。

Step 4:跑训练循环并观察提升

4 一轮一轮滚,盯着分数曲线
1. 初始评估:记录训练前基线(论文中 Qwen3-30B 基线较低)
2. 采样:让 Agent 在当前策略下跑一批任务
3. 打分:按 Step 3 公式给每条轨迹打分
4. 更新:用 RL 算法(PPO 类)更新外部策略
5. 循环:重复 2-4,每 10 轮记录一次得分

论文参考:ClawGym II 让 Qwen3-30B 在 PinchBench
上从基线提升 17.28 分——这就是「可见的提升曲线」
🚀 如果 20 轮后分数纹丝不动,先别调算法——大概率是奖励信号太稀疏,回头检查 Step 3 的评分公式。

Step 5:评估与防过拟合

5 换任务集验证,别让 Agent「背答案」
1. 留出验证集:训练任务与验证任务严格分开
2. 交叉验证:换 PinchBench 的另一个子集重测
3. 人工抽检:随机抽 20 条轨迹人工判断「行为是否合理」
4. 检查退化:训练后原提示词场景是否反而变差(回退机制)
5. 记录基线:保留训练前策略,必要时一键回滚

过拟合是头号敌人:训练集里表现 100 分、换个任务立刻打回原形,说明 Agent 在「背答案」而不是「学能力」。务必用未参与训练的独立任务集做最终验收。

Step 6:把训练成果部署回日常使用

6 从实验室到日常,收尾三件事
1. 固化策略:把训练好的策略导出为配置 / 提示词模板
2. 灰度上线:先在 10% 任务上启用新策略,对比成功率与成本
3. 持续采集:把线上真实任务回流为下一轮训练数据

至此,你就有了一条「越用越聪明」的 Agent 闭环:
真实任务 → 轨迹采样 → RL 训练 → 部署回用 → 再采样
🎉 想延伸了解「Agent 自己改进自己」的更多路线,可对比本中心《PenguinHarness:让 Agent 自己造 Agent》与《AgentENV 仿真训练底座》,三条路线侧重点不同。

常见问题速查

你遇到的现象大概率原因 & 解决
分数一直上不去奖励太稀疏:给过程步骤加中间奖励,缩小奖励粒度
换任务就崩过拟合:扩大训练集多样性,加验证集早停
训练很烧钱先用小模型+小任务集验证方案,再逐步放大
工具行为不可控把安全约束权重调高,禁区行为重罚
← 返回教程中心