DeepSeek công bố nền tảng sandbox: chạy 3 triệu lượt mỗi ngày

DeepSeek vừa công bố trên arXiv một báo cáo kỹ thuật có tên "DeepSeek Elastic Compute (DSec): hạ tầng sandbox cho huấn luyện tác nhân AI quy mô lớn", nộp ngày 19 tháng 9. Báo cáo nói về lớp môi trường thực thi mà DeepSeek dùng để huấn luyện và đánh giá các tác nhân AI (agent) — nơi mô hình viết mã, chạy lệnh, thao tác máy tính. Danh sách tác giả có hơn một trăm người, đơn vị chủ trì là DeepSeek-AI, trong đó có nghiên cứu sinh tiến sĩ của Đại học Thanh Hoa tham gia với tư cách thực tập sinh.

DeepSeek đã công bố không ít báo cáo về huấn luyện mô hình, nhưng đây là lần đầu tiên hãng tách riêng "thao trường" phía sau học tăng cường để viết thành một báo cáo riêng.

Bốn loại sandbox, một giao diện duy nhất

Thông qua một SDK thống nhất, DSec cung cấp bốn backend, sắp xếp theo mức độ cách ly và chi phí từ nhẹ đến nặng:

  • FnCall: tác vụ không trạng thái, ví dụ chấm bài trực tuyến (OJ)
  • Container: tác vụ kỹ thuật phần mềm, gọi công cụ
  • MicroVM Firecracker: tác vụ an ninh mạng cần mức cách ly mạnh hơn
  • Máy ảo đầy đủ (QEMU): phát triển Android, tác vụ nặng về đồ họa

Các loại tải công việc được hỗ trợ gồm tác vụ code ở cấp toàn bộ kho mã kiểu SWE-bench, khai thác lỗ hổng bảo mật, thao tác máy tính và phát triển di động. Phía framework huấn luyện chỉ cần gọi cùng một giao diện; việc chọn sandbox nào do lớp điều phối quyết định tùy theo tác vụ.

Vài con số kỹ thuật

Việc tải image chiếm khá nhiều dung lượng trong báo cáo. DSec lưu image ở định dạng EROFS, đặt trên 3FS — hệ thống tệp phân tán tự phát triển của DeepSeek — và đọc theo yêu cầu. So với cách làm truyền thống là tải toàn bộ image Docker về máy trước, thời gian hoàn thành cùng một lô tác vụ giảm từ hơn 60 phút xuống còn khoảng 35 phút, báo cáo đưa ra con số gấp 1,71 lần; tổng lượng ghi đĩa tích lũy giảm 57%.

Về bộ nhớ, báo cáo dùng virtio-pmem kết hợp DAX để nhiều máy ảo trên cùng một máy chia sẻ chung page cache thay vì mỗi máy giữ một bản riêng, giúp mức bộ nhớ đỉnh của host giảm 40,2%; cộng thêm cơ chế thu hồi trang nhàn rỗi qua DAMON và driver balloon, mức tiêu thụ bộ nhớ tích lũy theo thời gian giảm thêm 21,2%.

Còn một thiết kế liên quan trực tiếp đến huấn luyện: việc thực thi rollout được chuyển sang cho DSec, tách thành hai thành phần, sandbox của tác nhân và container làm việc cùng lưu trạng thái rollout đầy đủ. Các tác vụ huấn luyện trên GPU có thể bị chiếm quyền (preemptible); khi bị chiếm quyền, tương tác nhiều bước đang diễn ra không bị mất theo.

So với các bên ở nước ngoài

Lĩnh vực sandbox cho tác nhân AI ở nước ngoài đã có một nhóm công ty chuyên biệt. Khi OpenAI bổ sung sandbox cho Agents SDK vào tháng 4 năm nay, hãng dùng các bên thứ ba như E2B, Modal, Daytona, Cloudflare; sau đó Anthropic ra mắt sandbox tự lưu trữ, còn Cursor xây dựng sandbox mã nguồn ở cấp hệ điều hành. Các sản phẩm này nhắm đến nhà phát triển chạy tác nhân AI trong môi trường sản xuất, trọng tâm là ranh giới bảo mật và tính phí theo mức sử dụng.

Điểm xuất phát của DSec khác. Nó phục vụ chính việc huấn luyện học tăng cường của DeepSeek, cần giải quyết bài toán hàng triệu môi trường phải khởi tạo và hủy mỗi ngày mà không làm chậm GPU. Các con số về mức đồng thời và mật độ trong báo cáo hiếm khi được công khai ở các sản phẩm sandbox thương mại, nên khó so sánh trực tiếp.

Một số phòng thí nghiệm hàng đầu ở nước ngoài nhiều khả năng cũng có hệ thống tương tự trong nội bộ, nhưng hiếm khi công bố kiến trúc và số liệu thành bài báo. Lần này DeepSeek đã trình bày rõ sự đánh đổi giữa bốn backend cùng các biện pháp tối ưu image và bộ nhớ, cho các đội huấn luyện tác nhân AI trong nước một tài liệu tham chiếu để đối chiếu. Báo cáo không nói rõ DSec có mở mã nguồn hay không, cũng không đề cập việc có cung cấp dưới dạng dịch vụ đám mây hay không.

Nguồn tham khảo: CocoLoop, bài báo arXiv DeepSeek Elastic Compute (DSec), tài liệu Agents SDK của OpenAI; các con số về mức đồng thời, mật độ và tốc độ tải image đã được đối chiếu theo nội dung bài báo.