DeepSeek公開沙盒架構,單日跑300萬個

DeepSeek在arXiv公開一份技術報告,標題為《DeepSeek Elastic Compute (DSec):面向大規模智能代理訓練的沙盒基礎設施》,提交日期為9月19日。報告談的是DeepSeek在訓練與評測AI代理人時,讓模型寫程式碼、執行指令、操作電腦所使用的執行環境層。作者名單超過百人,主體單位是DeepSeek-AI,其中包含以實習身分參與的清華大學博士生。

模型訓練相關的報告,DeepSeek已發表不少;但把強化學習背後這套「訓練場」單獨寫成論文,這是第一次。

四種沙盒,一套介面

DSec透過統一SDK對外提供四種後端,依隔離強度與負擔由輕到重排列:

  • FnCall:無狀態任務,例如線上評測系統(OJ)
  • 容器:軟體工程、工具呼叫類任務
  • Firecracker microVM:需要更強隔離的資安滲透類任務
  • 完整虛擬機(QEMU):Android開發、圖形密集型任務

涵蓋的負載包括SWE-bench這類儲存庫層級的程式碼任務、資安漏洞利用、電腦操作與行動裝置開發。訓練框架端只呼叫同一套介面,底層要用哪種沙盒,由排程層依任務類型分配。

幾組工程數字

映像檔載入是報告著墨最多的部分。DSec把映像檔存成EROFS格式,放在DeepSeek自行開發的分散式檔案系統3FS上按需讀取。相較於傳統做法先把整個Docker映像檔拉到本機,同一批任務的完成時間從60多分鐘縮短到約35分鐘,報告給出的倍率是1.71倍;累計磁碟寫入量減少57%

在記憶體方面,報告採用virtio-pmem搭配DAX,讓同一台機器上的多個虛擬機共用同一份頁面快取,不必各自存一份,主機尖峰記憶體用量下降40.2%;再加上DAMON與氣球驅動程式的閒置頁面回收機制,按時間累積的記憶體用量再降21.2%。

還有一項設計與訓練直接相關:rollout的執行被搬到DSec上,拆成兩個元件,由AI代理人沙盒與工作容器共同保存完整的rollout狀態。GPU訓練任務可被搶佔,被搶佔時不會把進行中的多步互動一併帶走。

與海外同業放在一起看

AI代理人沙盒這門生意,海外已有一批專門的公司在做。OpenAI今年4月替Agents SDK加入沙盒功能時,串接的是E2B、Modal、Daytona、Cloudflare等第三方服務商;Anthropic之後推出自架式沙盒,Cursor則做了作業系統層級的程式碼沙盒。這些產品鎖定的是在正式環境跑AI代理人的開發者,關注重點是安全邊界與按用量計費。

DSec的出發點不同。它服務的是DeepSeek自身的強化學習訓練,要解決的是一天要啟動、銷毀數百萬個環境,同時不能拖慢GPU運算的問題。報告裡的同時執行數與密度數字,在對外銷售的沙盒產品裡很少見到公開口徑,無法逐一比較。

海外幾家頂尖實驗室內部很可能也有類似系統,但很少把架構與數字寫成論文公開。DeepSeek這次把四種後端的取捨、映像檔與記憶體的最佳化手法都攤開來講,讓中國國內做智能代理人訓練的團隊多了一份可以對照的工程參考。報告並未說明DSec是否會開放原始碼,也沒有提到是否會作為雲端服務對外提供。

參考來源:CocoLoop、arXiv論文DeepSeek Elastic Compute (DSec)、OpenAI Agents SDK文件;同時執行數、密度與映像檔載入加速的數字,皆以論文本文口徑核實。