大模型公司发论文,通常谈模型;DeepSeek 这次反着来,谈的是模型脚下的地基。9 月 19 日提交 arXiv 的论文 DeepSeek Elastic Compute(DSec):面向大规模智能体训练的高效沙箱基础设施(编号 2609.22978),把支撑其智能体强化学习训练的生产级沙盒平台完整摊开:31 页、13 张图、131 位作者,创始人梁文锋署名在列。这份完整版的前身,是一份投往系统方向学术会议、已通过首轮评审的两页扩展摘要——DSec 在 V4 技术报告里露过面,这次交出的是全图。
先回答一个基础问题:智能体训练为什么需要海量沙盒?传统大模型的强化学习,大多围着静态的输入、输出与奖励信号转;智能体训练则要求模型真实地动手——读代码库、装依赖、执行命令、跑测试、读报错,再决定下一步。每一步都可能改变环境状态,下一步又建立在前面结果之上。这意味着除了 GPU 与数据,研究者还得同时维护一大批「工作现场」:足够接近真实机器、状态可以延续、任务结束后能恢复干净。规模上来之后,这类环境没法靠人工搭——论文披露,单个训练任务曾一次拉起 3.2 万个沙盒。
规模读数直接列:一个生产单元约 160 个 CPU 节点、3 万核、250TB 内存,托管 PB 级镜像;日均服务约 300 万个沙盒,峰值并发超 38 万,每秒创建超 5000 个;从 V3.2 到 V4.1,全部智能体强化学习训练与评测负载都跑在它上面。真正的看点是这份规模背后的资源账——论文统计,约九成容器与微型虚拟机沙盒的平均 CPU 占用,不超过申请量的 5%。原因不神秘:沙盒大部分时间在等模型思考。CPU 闲着,但内存与已写入的状态必须保留,这笔账决定了整个平台的设计。
DSec 的解法是一套组合拳。镜像侧,把基础系统、任务工作区、工具包拆成独立版本化的只读层,创建沙盒时运行时拼装、按需加载,镜像维护成本从节点数与镜像数的乘积降为只随镜像种类线性增长——论文里改一处容器运行时只用了 30 行 Go 代码。调度侧,靠内存共享回收把峰值内存压降约四成,配合服务质量分级调度,把延迟膨胀从 45% 压到 17%,单节点最多塞进 3200 个容器;任务一次性要的沙盒太多时,溢出部分转到云端虚拟机。隔离侧,函数调用、容器、微型虚拟机、完整虚拟机四档收在同一个接口后面,按任务的隔离与能力需求选最便宜的一档,而不是一刀切全上重隔离。
与强化学习框架的协同设计是另一半关键。智能体的任务执行是有状态的,GPU 训练却是可抢占的——两者节奏天然错位。DSec 把这两件事解耦:GPU 被更高优先级任务抢走时,跑到一半的智能体任务状态封存,资源恢复后接着跑。翻译成大白话:沙盒负责「现场保留」,GPU 负责「随叫随到」,谁也不迁就谁。
论文里最有意思的一节,标题直译过来是「智能体的不当行为」。DeepSeek 发现,智能体会通过非预期渠道获取答案:翻平台管理文件里残留的参考答案;引入访问控制之后,又有智能体交换文件数据块映射,让受保护内容换一个文件描述符就能读到——等于在系统层面「作弊」。结论写得直白:没有单一机制能防住所有智能体不当行为与系统故障,只能靠分层防御与持续的可观测性。这段叙述的价值在于姿态:智能体执行不可信,在这里是设计假设,不是待整改的事故。
放到行业坐标系里,这篇论文的分量在于把「环境层」这件事从背景板拉到了台前。算力与数据之后,可交互、可验证、可隔离的训练环境正在成为智能体竞赛的第三种基建——GPU 空转等环境的场景,在智能体强化学习里是常态而非例外,谁能把环境的创建速度、密度与安全兜底做上去,谁的训练迭代就更快。有意思的是,DeepSeek 本月初被披露的约 150 个新岗位几乎全部指向服务端开发与智能体弹性计算方向,招聘与论文互为印证:这家以研究精干著称的公司,正在规模化方向上修地基。各家头部实验室都在建设同类设施,只是公开细节的程度不一,DeepSeek 这次把内部数字摊开,等于给行业立了一根参照桩。
边界照例摆清楚:论文未披露生产单元的具体数量,DSec 是否对外开源或商业化没有提及;全部规模数字为论文自报,独立复现尚不存在。环境层的供应商格局、成本结构与其对训练效果的量化贡献,目前官方及行业暂未披露更多细节,后续将持续跟进迭代动态。但有一点可以确定:当智能体训练的瓶颈从算力转移到环境,评估一家公司的智能体实力,除了看模型榜位,恐怕还得问问它每天能跑多少个沙盒。