8 月 18 日,中国人民大学高瓴人工智能学院与至知创新研究院联合提出 ClawGym II——一个面向复杂 Agent Harness 的黑盒强化学习框架。它最特别的一点是:不需要改动 Claude Code、OpenClaw 等现成 Agent 工具的任何内部实现,直接把它们的「真实执行过程」当作强化学习环境来训练,以 Qwen3-30B 为骨干模型,在 PinchBench 基准上提升了 17.28 分。
先搞懂:Agent 也能「训练」?黑盒 RL 是什么
平时我们说的「调 Agent」,多半是改提示词、换模型、调参数——这是使用层的优化。而 ClawGym II 做的事情是训练层的优化:把 Agent 当作一个可学习的策略,通过强化学习(RL)让它自己在任务中「学到」更好的行为,比如更会规划、更会选工具、更会收敛在关键步骤上。
| 对比项 | 传统微调(SFT) | 黑盒 RL(ClawGym II) |
|---|---|---|
| 能否改模型权重 | 需要,成本高 | 不需要,完全黑盒 |
| 能否改工具代码 | 看情况 | 不需要,开箱即用 |
| 优化什么 | 模型参数 | Agent 的执行策略与行为 |
| 对现成工具(Claude Code 等) | 无能为力 | 直接可用 |
「黑盒」不等于「玄学」:ClawGym II 通过观察 Agent 的输入输出(行动序列与结果)来更新一个外部策略,全程不碰工具内部实现。它要求你有清晰的奖励信号——奖励怎么设计,直接决定训练出什么「性格」的 Agent。
Step 1:理解 ClawGym II 的定位与适用场景
1. 输入:一个现成的 Agent Harness(Claude Code / OpenClaw / 自建)
2. 骨干模型:论文用 Qwen3-30B,你可换成任意可调用的模型
3. 交互方式:Agent 每轮输出行动 → 环境执行 → 返回结果与奖励
4. 产出:训练好的外部策略,指导 Agent 更好地完成任务
适合的场景:
· 固定任务域(客服、代码修复、资料整理)想越用越顺
· 团队想让 Agent 学会「少犯错、少烧 Token」
· 想复现论文思路做实验(PinchBench / SWE-bench 类任务)
Step 2:准备训练环境与骨干模型
1. 环境层:准备带 Docker / 沙箱的机器,跑真实任务
2. Agent 层:装好 Claude Code 或 OpenClaw,配好工具权限
3. 模型层:选择骨干模型(Qwen3-30B 或你已有的 API)
4. 接口层:把 Agent 的「行动-结果」串成 RL 可消费的轨迹
5. 数据层:准备训练任务集(从 PinchBench / 业务题库中抽取)
最小验证:先跑通 1 个任务的完整轨迹,再扩规模
注意资源消耗:RL 训练要反复执行真实任务,比普通推理贵得多。建议先用 10-20 个任务小规模验证奖励设计是否合理,再放大,避免预算失控。成本精算可参考《Agent 经济学》。
Step 3:设计奖励信号
奖励三要素(按重要度排序):
1. 任务成功率(+1.0):最终结果是否正确 / 通过测试
2. 过程效率(+0.2):步数越少、Token 越省,奖励越高
3. 安全约束(-0.5):触碰禁区(删库、发外网、越权)重罚
示例评分公式:
score = 完成奖励 × 0.6 + 效率奖励 × 0.25 + 安全惩罚 × 0.15
Step 4:跑训练循环并观察提升
1. 初始评估:记录训练前基线(论文中 Qwen3-30B 基线较低)
2. 采样:让 Agent 在当前策略下跑一批任务
3. 打分:按 Step 3 公式给每条轨迹打分
4. 更新:用 RL 算法(PPO 类)更新外部策略
5. 循环:重复 2-4,每 10 轮记录一次得分
论文参考:ClawGym II 让 Qwen3-30B 在 PinchBench
上从基线提升 17.28 分——这就是「可见的提升曲线」
Step 5:评估与防过拟合
1. 留出验证集:训练任务与验证任务严格分开
2. 交叉验证:换 PinchBench 的另一个子集重测
3. 人工抽检:随机抽 20 条轨迹人工判断「行为是否合理」
4. 检查退化:训练后原提示词场景是否反而变差(回退机制)
5. 记录基线:保留训练前策略,必要时一键回滚
过拟合是头号敌人:训练集里表现 100 分、换个任务立刻打回原形,说明 Agent 在「背答案」而不是「学能力」。务必用未参与训练的独立任务集做最终验收。
Step 6:把训练成果部署回日常使用
1. 固化策略:把训练好的策略导出为配置 / 提示词模板
2. 灰度上线:先在 10% 任务上启用新策略,对比成功率与成本
3. 持续采集:把线上真实任务回流为下一轮训练数据
至此,你就有了一条「越用越聪明」的 Agent 闭环:
真实任务 → 轨迹采样 → RL 训练 → 部署回用 → 再采样
常见问题速查
| 你遇到的现象 | 大概率原因 & 解决 |
|---|---|
| 分数一直上不去 | 奖励太稀疏:给过程步骤加中间奖励,缩小奖励粒度 |
| 换任务就崩 | 过拟合:扩大训练集多样性,加验证集早停 |
| 训练很烧钱 | 先用小模型+小任务集验证方案,再逐步放大 |
| 工具行为不可控 | 把安全约束权重调高,禁区行为重罚 |