2026 年 5 月 28 日,英伟达研究团队正式开源了名为 Polar 的强化学习训练框架。这一框架的核心突破在于:无需修改任何现有代码 Agent 的源代码,即可将其无缝集成到 GRPO(广义相对策略优化)强化学习训练中,显著降低了 AI 编码 Agent 进化过程中的技术门槛。
从"手动调参"到"系统化训练"
过去,要让一个 AI 编码 Agent 通过强化学习提升能力,通常需要将执行框架集成到 RL 基础设施中。这个过程不仅集成成本高昂,还会在数据传输中丢失关键信息——prompt、采样 token、对数概率等训练所需的核心数据无法被完整采集。
Polar 的解题思路非常直接:将"模型 API 边界"作为强化学习的训练入口点。它通过设置一个透明的代理网关(Gateway),拦截并转发 Agent 调用不同 API(Anthropic、OpenAI、Google 等)的请求,在转发过程中实时记录 prompts、采样 token 和对数概率,然后重建为训练所需的 trace 数据。
这意味着:无论是 OpenAI 的 Codex、Anthropic 的 Claude Code,还是阿里的 Qwen Code,开发者都可以直接"插上" Polar 进行强化学习训练,无需重写代码,无需修改执行框架。
性能数据的惊人跃升
在 SWE-Bench Verified 基准测试中,Polar 交出了一份令人瞩目的成绩单。使用相同的 Qwen3.5-4B 基础模型,各代码框架训练前后的表现如下:
| 代码框架 | 训练前 (pass@1) | 训练后 (pass@1) | 提升幅度 |
|---|---|---|---|
| Codex | 3.8% | 26.4% | +594.7% |
| Claude Code | 29.8% | 34.6% | +16.1% |
| Pi 框架 | 34.2% | 40.4% | +18.1% |
Codex 的表现堪称惊人——性能提升了近 6 倍,从几乎不可用的水平一跃成为可以应对真实编码任务的工具。而 Claude Code 和 Pi 框架也有 16%-18% 的稳定提升,说明即使对于已经表现出色的 Agent,强化学习训练仍然是有效的增强手段。
系统级优化与效率突破
除了算法层面的创新,Polar 在系统效率方面也做了大量工作。其核心优化策略 prefix_merging,与传统的 per_request 模式相比:训练耗时缩短约 5.39 倍,GPU 利用率从 20.4% 提升至 87.7%。
这一数据意味着,原本需要消耗大量 GPU 资源的强化学习训练,现在可以在更短的时间内、以更低的成本完成。Polar 还通过预热缓冲区(READY buffer)和并行任务处理机制,有效消除了阻塞 GPU 训练的长尾任务,进一步降低了算力门槛。
Polar 的 Rollout Server 负责任务调度和数据持久化,Gateway Node 处理生命周期和资源回收,两者协同工作,为大规模训练提供了系统级的工程保障。
行业意义:Agent 进化的基础设施
Polar 的开源标志着 AI 编码 Agent 的进化路径正在从"实验室手工调整"转向"大规模系统化生产"。它的战略价值体现在三个层面:
第一是标准化。Polar 为 Agent 通往强化学习训练搭建了一条"高速公路",统一定义了数据采集、调度执行、效率优化的工程规范,让研究人员和开发者不再需要关心"如何使模型适应训练框架"。
第二是低门槛。利用海量的开源代码框架,即使是资源有限的团队也能对已有 Agent 进行高效的强化学习训练。Codex 通过 Polar 获得近 6 倍提升的案例,证明了这一路径对"潜力待挖掘"的模型尤其有效。
第三是生态效应。英伟达选择开源而非闭源,意图明显——让 Polar 成为 Agent 强化学习训练的事实标准。随着更多社区贡献的融入,这一框架有望加速整个 AI 编码 Agent 领域的能力进化速度。