Ngày 24/8, NVIDIA công bố một loạt dữ liệu thử nghiệm sớm của hệ thống Vera Rubin NVL72: trên các tải trọng dạng tác nhân (agentic), thông lượng tính theo mỗi megawatt đạt gấp 30 lần thế hệ GB300 NVL72 trước đó, trong khi chi phí trên mỗi token giảm xuống còn khoảng 1/35. Đi kèm số liệu là một dòng chú thích: kết quả vẫn đang chờ SemiAnalysis kiểm chứng.
Bài thử nghiệm sử dụng bộ tải AgentX của SemiAnalysis, được xây dựng từ các quỹ đạo lập trình tác nhân thực tế, chứ không phải các yêu cầu tổng hợp trong phòng thí nghiệm. Năm mô hình được dùng để chấm điểm gồm Kimi K3, MiniMax M3, GLM5.3, Qwen3.5 và DeepSeek V4 Pro — toàn bộ đều là trọng số mã nguồn mở, trong đó bốn mô hình đến từ các nhóm phát triển Trung Quốc. Danh sách này tự nó đã nói lên một điều: để đánh giá một thế hệ rack suy luận mới có tốt hay không, NVIDIA chọn hệ quy chiếu là những mô hình mã nguồn mở mà các nhà phát triển đang thực sự sử dụng.
Vì sao thước đo lại là “mỗi megawatt”
Các so sánh giữa thế hệ theo cách truyền thống thường dùng hiệu năng đỉnh hoặc hiệu năng trên mỗi card. Lần này NVIDIA đổi mẫu số sang điện năng.
Lý do nằm ở cấu trúc tải trọng. Theo thống kê của OpenRouter, một yêu cầu dạng tác nhân tiêu tốn lượng token gấp 15 lần một yêu cầu hội thoại thông thường — tác nhân phải truy vấn cơ sở dữ liệu, tìm kiếm tài liệu, gọi các sub-agent, và phải mang theo ngữ cảnh ngày càng dài qua nhiều vòng suy luận. Khi mức tiêu thụ token của một tác vụ đơn lẻ tăng lên cả một bậc độ lớn, thứ thường kìm hãm khả năng mở rộng lại là số megawatt mà trạm biến áp có thể cấp, chứ không phải số lượng GPU.
Mốc so sánh dọc mà NVIDIA đưa ra là: thông lượng mỗi megawatt của GB300 NVL72 trên DeepSeek V4 Pro đã gấp 15 lần kiến trúc Hopper. Vera Rubin nhân thêm một lần nữa trên nền đó.
Tách ra để xem, con số 30 lần không đến từ một khâu duy nhất. Bộ công nghệ cấp điện và tản nhiệt DSX MaxLPS giúp triển khai thêm 40% số GPU trong cùng một ngân sách megawatt, tương đương với việc pha loãng mẫu số trước; NVLink 6 nâng tốc độ gói tin lên gấp 10 lần các giải pháp Ethernet hiện có và giảm độ trễ xuống còn 1/3; ở lớp trên là cả một hệ thống phối hợp phần cứng - phần mềm — dịch vụ tách rời (disaggregated serving), bộ nhớ đệm KV phân tán, xử lý song song chuyên gia (expert parallelism). Mỗi biện pháp đóng góp một hệ số nhân riêng, cộng dồn lại mới ra con số cuối cùng.
Một phép tính sơ bộ
Hãy thử tính sơ bộ theo cách nói chính thức xem hệ số này tương ứng với quy mô nào trên sổ sách.
Giả sử một cụm suy luận công suất 100 megawatt, giá điện ước tính 0,5 nhân dân tệ/kWh, chạy hết công suất suốt một năm sẽ tốn khoảng 440 triệu nhân dân tệ tiền điện. Nếu thông lượng mỗi megawatt thực sự tăng gấp 30 lần, cùng khoản tiền điện đó sẽ mua được lượng token đầu ra gấp 30 lần; nhìn theo chiều ngược lại, để tạo ra cùng một lượng token, chi phí điện có thể giảm xuống còn 1/30 so với trước. Còn mức giảm 35 lần về chi phí trên mỗi token — con số này nhỉnh hơn một chút so với mức tăng 30 lần về thông lượng, phần chênh lệch đến từ việc cải thiện hiệu suất năng lượng của bản thân rack, khác với việc tăng tổng sản lượng.
Kiểu tính sơ bộ này có những sai lệch rõ ràng: trung tâm dữ liệu thực tế không chạy hết công suất suốt cả năm, các yếu tố như PUE, tỷ lệ nhàn rỗi, việc chạy lẫn nhiều mô hình đều sẽ kéo hệ số này xuống thấp hơn. Nhưng ít nhất nó cho thấy vì sao NVIDIA lại đặt thước đo này lên hàng đầu. Với các nhà vận hành trung tâm dữ liệu đã có sẵn hạn ngạch điện nhưng vẫn đang xếp hàng chờ công suất trạm biến áp mới, sản lượng trên mỗi megawatt gần với khái niệm “năng lực sản xuất” hơn là tổng năng lực tính toán.
Vài điều cần nhớ trước khi có kết quả kiểm chứng
Bộ số liệu này hiện vẫn là do chính hãng tự đo. Đánh giá của SemiAnalysis chưa có kết quả, và bản thân NVIDIA cũng gắn nhãn đây là số liệu đo lường sớm.
Các điều kiện ràng buộc cũng cần được nhìn rõ. Con số 30 lần tương ứng với quỹ đạo lập trình tác nhân — thuộc nhóm kịch bản ngữ cảnh dài, mật độ token cao, đúng vào vùng lợi thế kiến trúc của Vera Rubin; nếu đổi sang hội thoại ngắn, tạo ảnh hoặc embedding hàng loạt, hệ số sẽ không còn là con số này. Khoảng cách giữa tuyên bố khi chuyển thế hệ và những gì thực sự được giao là quy luật cũ của ngành này — chu kỳ chuyển từ Hopper sang Blackwell đã từng diễn ra y hệt.
“Agentic AI workloads consume 15x more tokens than a simple chat request.”
Tải trọng AI dạng tác nhân tiêu tốn lượng token gấp 15 lần một yêu cầu hội thoại đơn giản.
Kéo dài mốc thời gian này ra sẽ thấy rõ hơn: Dell đã bắt đầu chào giá suy luận dựa trên máy chủ Vera Rubin, còn SpaceX dự kiến năm sau sẽ đưa rack NVL72 lên quỹ đạo để thử nghiệm tính toán AI trên quỹ đạo. Phần cứng còn chưa được triển khai đại trà, nhưng các phép tính xoay quanh nó đã được thực hiện qua nhiều vòng. Thứ thực sự có thể kiểm chứng con số 30 lần chính là những con số mà từng đơn vị tự đo được trong trung tâm dữ liệu của mình, sau khi có kết quả kiểm chứng độc lập.
Nguồn tham khảo: blog kỹ thuật chính thức của NVIDIA, tài liệu mô tả benchmark AgentX của SemiAnalysis, CocoLoop, số liệu thống kê sử dụng của OpenRouter; hệ số thông lượng mỗi megawatt, mức giảm chi phí token và mật độ triển khai GPU tăng 40% đều được đối chiếu theo công bố chính thức, còn phần tính toán chi phí điện là ước tính sơ bộ của tòa soạn.