NVIDIA phát hành mã nguồn mở toàn bộ dòng Nemotron 3 cùng dữ liệu huấn luyện

Huang Renxun muốn cắm một lá cờ trên thị trường mô hình nguồn mở

Khi nhiều người nghĩ rằng NVIDIA chỉ bán GPU, hãng đã âm thầm phát hành toàn bộ dòng Nemotron 3 – không chỉ trọng số mô hình, mà còn mã nguồn mở toàn bộ bộ dữ liệu tiền huấn luyện 3 nghìn tỷ token, quy trình học tăng cường và công cụ đánh giá.

Thông điệp từ động thái này rất rõ ràng: NVIDIA không chỉ muốn làm người bán xẻng, mà muốn chiếm một vị trí trong hệ sinh thái AI nguồn mở.

Ba kích thước, tất cả đều dùng kiến trúc MoE

Dòng Nemotron 3 sử dụng kiến trúc MoE không gian tiềm ẩn lai (Hybrid Latent MoE), gồm ba phiên bản:

Phiên bản Tổng tham số Tham số kích hoạt mỗi lần Trạng thái
Nano 30 tỷ Khoảng 3 tỷ Đã phát hành
Super Khoảng 100 tỷ Khoảng 10 tỷ Nửa đầu 2026
Ultra Khoảng 500 tỷ Khoảng 50 tỷ Nửa đầu 2026

Lợi thế cốt lõi của MoE là: quy mô tham số lớn, nhưng mỗi lần suy luận chỉ kích hoạt một phần nhỏ, do đó chi phí tính toán thực tế có thể kiểm soát được. DeepSeek V3, Llama 4 cũng đang áp dụng cách tiếp cận tương tự, và giờ NVIDIA đã theo kịp.

Điểm chuẩn của Nano khá thú vị

Phiên bản Nano đã phát hành, dữ liệu chính thức công bố:

  • Tốc độ suy luận gấp 4 lần thế hệ trước
  • Lượng token sinh ra trong suy luận giảm 60% (có thể đạt kết luận với ít bước trung gian hơn)
  • Cửa sổ ngữ cảnh 1 triệu token

Đánh giá từ tổ chức kiểm định độc lập Artificial Analysis: "Mức độ mở cao nhất và hiệu quả tốt nhất trong số các mô hình cùng kích thước, độ chính xác cũng dẫn đầu".

Hướng "suy luận hiệu quả" này có phần tương đồng với cách tiếp cận chú ý thưa của DeepSeek V3.2 – xu hướng chung là giảm khối lượng tính toán mà không hy sinh chất lượng.

Bộ công cụ hoàn toàn mở

NVIDIA đồng thời phát hành mã nguồn mở một bộ công cụ đi kèm:

  • NeMo Gym: Khung huấn luyện học tăng cường cho tác nhân
  • NeMo RL: Thư viện quy trình học tăng cường
  • NeMo Evaluator: Công cụ đánh giá

Trọng số mô hình, dữ liệu huấn luyện và bộ công cụ đều được đăng tải trên Hugging Face và GitHub, với giấy phép hoàn toàn mở, bất kỳ ai cũng có thể tải xuống, tinh chỉnh và triển khai.

Tại sao NVIDIA làm điều này

Có một số logic khả thi:

Phần mềm ràng buộc phần cứng. Bạn dùng bộ công cụ mô hình nguồn mở của NVIDIA, khả năng cao sẽ dùng GPU NVIDIA để chạy. Điều này tương tự logic của CUDA năm xưa: dùng hệ sinh thái để khóa hạ tầng tính toán.

Đối phó áp lực cạnh tranh nguồn mở. Các mô hình nguồn mở như DeepSeek, Llama 4, Qwen ngày càng mạnh. Nếu NVIDIA chỉ làm lớp phần cứng, tiếng nói trong hệ sinh thái AI sẽ bị pha loãng. Làm mô hình nguồn mở đồng nghĩa với việc trực tiếp tham gia cuộc chơi.

Gói bán hàng doanh nghiệp. Nhiều doanh nghiệp lớn mua GPU NVIDIA kèm gói dịch vụ, việc tích hợp sẵn các mô hình nguồn mở đáng tin cậy là điểm cộng, cũng là một phần của tài liệu bán hàng.

Tất nhiên, mã nguồn mở cũng là chi phí đối với NVIDIA. Nhưng với tiềm lực tài chính hiện tại của hãng, đây không phải vấn đề.

Đáng chờ đợi là Super và Ultra

Phiên bản Nano hiện tại có quy mô tương đối khiêm tốn. Điều thực sự đáng mong đợi là Super (100 tỷ tham số) và Ultra (500 tỷ tham số) vào nửa đầu năm 2026 – nếu điểm chuẩn của Nemotron 3 Ultra đủ tốt, thì đây không chỉ đơn giản là "NVIDIA cũng làm mô hình", mà là một đối thủ thực sự cạnh tranh trên bảng xếp hạng mô hình nguồn mở.

Nguồn tham khảo: CocoLoop, NVIDIA Debuts Nemotron 3 Family of Open Models (NVIDIA Newsroom)