DeepSeek a publié sur arXiv un rapport technique intitulé « DeepSeek Elastic Compute (DSec) : infrastructure de sandbox pour l'entraînement d'agents à grande échelle », déposé le 19 septembre. Le rapport décrit la couche d'exécution utilisée par DeepSeek pour entraîner et évaluer des agents, c'est-à-dire l'environnement dans lequel les modèles écrivent du code, exécutent des commandes et manipulent un ordinateur. La liste des auteurs dépasse la centaine, DeepSeek-AI étant l'organisme principal ; parmi les contributeurs figurent des doctorants de l'université Tsinghua, intervenus en tant que stagiaires.
DeepSeek a déjà publié plusieurs rapports sur l'entraînement de modèles, mais c'est la première fois que cette « salle d'entraînement » qui sous-tend l'apprentissage par renforcement fait l'objet d'une publication séparée.
Quatre types de sandbox, une seule interface
Via un SDK unifié, DSec propose quatre backends, classés du plus léger au plus lourd en termes d'isolation et de coût :
- FnCall : tâches sans état, comme les juges en ligne (OJ)
- Conteneurs : ingénierie logicielle et tâches avec appels d'outils
- MicroVM Firecracker : tâches de sécurité offensive nécessitant une isolation plus forte
- Machine virtuelle complète (QEMU) : développement Android et tâches intensives en graphisme
Les charges de travail couvertes incluent des tâches de code à l'échelle d'un dépôt dans l'esprit de SWE-bench, l'exploitation de failles de sécurité, la manipulation d'un ordinateur et le développement mobile. Côté framework d'entraînement, un seul appel à cette même interface suffit ; c'est la couche d'ordonnancement qui choisit le sandbox à utiliser selon la tâche.
Quelques chiffres d'ingénierie
Le chargement des images occupe une bonne part du rapport. DSec stocke les images au format EROFS, sur 3FS, le système de fichiers distribué maison de DeepSeek, et les lit à la demande. Comparé à l'approche classique consistant à d'abord télécharger toute l'image Docker en local, le temps de complétion pour le même lot de tâches est passé de plus de 60 minutes à environ 35 minutes, soit un facteur de 1,71 selon le rapport ; les écritures disque cumulées ont baissé de 57 %.
Côté mémoire, le rapport utilise virtio-pmem associé à DAX pour que plusieurs machines virtuelles sur une même machine partagent le cache de pages au lieu d'en conserver chacune une copie, ce qui a fait chuter le pic de mémoire de l'hôte de 40,2 % ; combiné à la récupération des pages inactives via DAMON et un pilote ballon, la consommation mémoire cumulée dans le temps a encore baissé de 21,2 %.
Une autre conception est directement liée à l'entraînement : l'exécution du rollout a été déplacée vers DSec et scindée en deux composants, le sandbox de l'agent et le conteneur de travail conservant ensemble l'état complet du rollout. Les tâches d'entraînement sur GPU sont préemptibles ; lorsqu'une tâche est préemptée, l'interaction multi-étapes en cours n'est pas perdue.
Comparé aux acteurs étrangers
Le marché des sandboxes pour agents compte déjà à l'étranger un groupe d'entreprises spécialisées. Quand OpenAI a ajouté une fonction de sandbox à l'Agents SDK en avril dernier, elle s'est appuyée sur des fournisseurs tiers comme E2B, Modal, Daytona et Cloudflare ; Anthropic a ensuite lancé un sandbox auto-hébergé, et Cursor a construit un sandbox de code au niveau du système d'exploitation. Ces produits ciblent les développeurs qui font tourner des agents en production, avec un accent mis sur les limites de sécurité et la facturation à l'usage.
Le point de départ de DSec est différent. Il sert l'entraînement par renforcement propre à DeepSeek et doit résoudre le problème de plusieurs millions d'environnements à lancer et détruire chaque jour, sans ralentir les GPU. Les chiffres de concurrence et de densité cités dans le rapport sont rarement rendus publics par les produits de sandbox commerciaux, ce qui rend toute comparaison directe impossible.
Plusieurs grands laboratoires étrangers disposent probablement de systèmes similaires en interne, mais publient rarement leur architecture et leurs chiffres sous forme d'article scientifique. Cette fois, DeepSeek a détaillé les arbitrages entre les quatre backends ainsi que les techniques d'optimisation des images et de la mémoire, offrant aux équipes qui entraînent des agents en Chine une référence de comparaison. Le rapport ne précise pas si DSec sera publié en open source, ni s'il sera proposé comme service cloud.
Sources : CocoLoop, article arXiv DeepSeek Elastic Compute (DSec), documentation de l'Agents SDK d'OpenAI ; les chiffres de concurrence, de densité et d'accélération du chargement d'images ont été vérifiés dans le texte de l'article.