把「耐力」从提示词里解放出来
九月二十八日提交的 arXiv 论文 Marathoner(编号 2609.34378,作者 Zhang Ruiyang 等,单位含澳门大学与阿里蚂蚁)想解决的是智能体里最反直觉的一道坎:很多模型能漂亮地开始一个任务,却撑不完一条跨数百步、连续数小时乃至更久的长链。论文把这种能力叫「超长程自主执行」,并直言 Anthropic 的 Fable 5、OpenAI 的 GPT-6-Astra 这类闭源模型已经在往这个方向砸资源,能连续工作数天。Marathoner 的做法不是换一个更大的基座,而是一条完整的后训练流水线,把「耐力」从提示词工程里解放出来,变成模型自带的性质。它的定位很清楚:和那些已经很能打的专有模型比长程,而不是在短任务榜上刷分。
数据从哪来:千行级真实 PR
流水线先做的是「超长程任务合成」,数据来源不是合成小题,而是直接从 GitHub 各仓库挑那些新增代码超千行的大版本发布 PR,把它们当成最难的任务级样本。这个选择很讲理:真实大 PR 天然带着跨文件依赖、长链条推理和复杂验收,比人造题更接近「资深工程师要做好几天」的活。第二步是「多任务链」,把多条生成的任务串成一条更难的单一任务,借此造出前沿难度的合成题。第三步是拒绝采样微调:用强教师模型配多种执行 harness,在合成任务上产出轨迹,再对通过拒绝采样的轨迹做监督微调。三步叠加,等于先有真实难度的题,再有更难的题,最后用高质量轨迹把耐力「教」进基座。这种做法的代价是执行密集,但换的是真实分布而非玩具分布。
强化学习在真实沙箱里跑,而不是在模拟里算分
Marathoner 的强化学习阶段,冷启动后的模型在独立沙箱里通过 harness 做真实世界执行,rollout 过程里直接拿真实反馈,而不是在离线的奖励模型上打分。这一步是它和很多「只在轨迹上做 SFT」的路线分叉的地方——长程能力的核心恰恰是状态能不能跨数百步不丢、遇到死路能不能恢复、知道什么时候算真的做完,这些只有真执行才学得出来。论文还提了一个新奖励策略「后段奖励」(Later Stage Bonus Reward),显式鼓励模型在执行后段仍做出有意义的动作,专治那种「前面装忙、后面草草收场」的烂尾。评估上,它在五个含超长程任务的基准上相对基座取得一致且明显的提升,甚至超过一个强专有模型;进一步分析显示它能连续工作十小时以上、在极难任务上做千余次工具调用。
代价与边界
账要算全。Marathoner 用真实沙箱执行换来耐力,付出的是实打实的数据与算力工程成本:千行 PR 合成、沙箱内 rollout、多 harness 协调,每一环都是钱和时间。能力到位了,边界也清楚:论文验证的模型家族与任务有限,泛化到完全不同领域、不同工具生态的稳健性仍待更多任务确认;十小时连续执行的账单与稳定性,在真实生产里是另一道工程关。更别提长程任务本身的评估就很难——腾讯 HY 的 Long-Horizon Terminal-Bench 用四十六个任务测十八个前沿模型,最好的也只拿到约零点五一的平均分、没有任何模型通过三分之一以上任务,说明「能撑住」离「能交付」仍有距离。Marathoner 把耐力做成模型性质这一步有长期价值,但它仍停留在论文阶段,距离可部署的产品化智能体还有工程落差,官方及行业暂未披露更多细节,后续将持续跟进迭代动态。
给工程化的两条启发
抛开基准,Marathoner 给做长程智能体的团队两点可操作启发。其一,后段也要设可量化动作奖励,比只看最终交付更能防「草草收场」——很多长任务不是输在不会做,而是输在中途状态漂移、探索变循环、预算烧完目标才到一半。其二,数据要贴真实工作分布:与其堆短题,不如把真实大 PR、真实长链路当合成源头,因为长程失败模式只在长链里才暴露。它和同期 GLM-5.2 等把一百万上下文当底座的思路是同一件事的两面——一个从数据奖励端喂耐力,一个从上下文端托住状态,殊途同归。
一句收尾
Marathoner 把「跑马拉松」从一句比喻,做成了一条可复现的后训练配方:真实 PR 当题、多任务链加难、拒绝采样教、沙箱里真跑、后段给奖励。它提醒行业,长程智能体的下一关不在模型更大,而在让模型学会不烂尾。