DeepSeek 在 arXiv 上公开了一份技术报告,标题是《DeepSeek Elastic Compute (DSec):面向大规模智能体训练的沙箱基础设施》,提交日期 9 月 19 日。报告讲的是 DeepSeek 训练和评测智能体时,让模型去写代码、跑命令、操作电脑的那一层执行环境。作者名单超过百人,主体单位是 DeepSeek-AI,其中有清华大学的博士生以实习身份参与。
模型训练的报告,DeepSeek 发过不少;把强化学习背后这套”练兵场”单独拿出来写,这是第一次。
四种沙箱,一套接口
DSec 通过统一的 SDK 对外提供四种后端,按隔离强度和开销从轻到重排:
- FnCall:无状态任务,比如在线判题(OJ)
- 容器:软件工程、工具调用类任务
- Firecracker microVM:安全渗透类任务,需要更强隔离
- 完整虚拟机(QEMU):安卓开发、图形密集型任务
覆盖的负载包括 SWE-bench 这类仓库级代码任务、安全漏洞利用、电脑操作和移动端开发。训练框架那一侧只调同一套接口,底下用哪种沙箱由调度层按任务分配。
几组工程数字
镜像加载是报告里着墨较多的部分。DSec 把镜像存成 EROFS 格式,放在 DeepSeek 自研的 3FS 分布式文件系统上按需读取。和传统做法里先把整个 Docker 镜像拉到本地相比,同一批任务的完成时间从 60 多分钟缩到约 35 分钟,报告给的倍数是 1.71 倍;累计磁盘写入减少 57%。
内存上,报告用 virtio-pmem 配合 DAX,让同一台机器上的多个虚拟机共用页缓存,不再每台各存一份,宿主机峰值内存下降 40.2%;再加上 DAMON 和气球驱动的空闲页回收,按时间累计的内存占用又降了 21.2%。
还有一处设计和训练直接相关:rollout 的执行被挪到 DSec 上,拆成两个组件,由智能体沙箱和工作容器共同保存完整的 rollout 状态。GPU 训练任务是可抢占的,被抢占时不会把正在进行中的多步交互一起带走。
和海外同行放在一起看
智能体沙箱这门生意,海外已经有一批专门的公司。OpenAI 今年 4 月给 Agents SDK 加沙箱时,接的是 E2B、Modal、Daytona、Cloudflare 等第三方服务商;Anthropic 后来推了自托管沙箱,Cursor 做了操作系统级的代码沙箱。这些产品面向的是开发者在生产环境里跑 Agent,关注点是安全边界和按量计费。
DSec 的出发点不一样。它服务的是 DeepSeek 自己的强化学习训练,要解决的是一天几百万个环境要拉起、销毁,同时不能拖慢 GPU。报告里的并发和密度数字,放在对外售卖的沙箱产品里很少见到公开口径,没法做一对一的比较。
海外几家头部实验室内部大概率也有同类系统,但很少把架构和数字写成论文。DeepSeek 这次把四种后端的取舍、镜像和内存的优化手段都摊开了,国内做智能体训练的团队多了一份可以对照的工程参考。报告没有说 DSec 是否会开源代码,也没有提会不会作为云服务对外提供。
参考来源:CocoLoop、arXiv 论文 DeepSeek Elastic Compute (DSec)、OpenAI Agents SDK 文档;并发、密度与镜像加载提速数字以论文正文口径核验。