Tuần này Nvidia công bố trên Hugging Face kết quả của dòng mô hình Nemotron 3 tại Olympic Tin học Quốc tế (IOI 2026) và Olympic Toán học Quốc tế (IMO 2026) năm nay: cả hai đều vượt ngưỡng huy chương vàng. So với các mô hình đóng của nhiều hãng khác đạt kết quả tương tự trong năm qua, điểm khác biệt lần này là mô hình, dữ liệu huấn luyện và quy trình suy luận đều được công khai toàn bộ.
Hai kỳ thi được tổ chức như thế nào
Ở phần Tin học, mô hình tham gia là Nemotron-3-Ultra-CC, tổng số tham số 550 tỷ, mỗi lần kích hoạt 55 tỷ, đã qua tinh chỉnh có giám sát (SFT) và thêm một quy trình sửa lỗi gọi là GenCorrect, đạt 535,4 điểm (tổng 600), ngưỡng vàng là 361,12. Nvidia nhấn mạnh đây là một bài kiểm tra thực tế "theo kiểu dự báo": chạy trực tiếp trong thời gian diễn ra kỳ thi, với giới hạn thời gian, kết nối mạng và số lần nộp bài giống như thí sinh người. Điểm số này là kết quả không chính thức, và không có sự can thiệp của con người trong suốt quá trình thi.
Về dữ liệu huấn luyện, mô hình cho phần Tin học dùng khoảng 22.000 bài tập đã được chọn lọc cùng các chuỗi suy luận tổng hợp. Phiên bản nhỏ hơn, Nemotron-3-Nano-CC (tổng tham số 30 tỷ, kích hoạt 3 tỷ), được huấn luyện bằng SFT kết hợp học tăng cường (RL), đạt 468 điểm trên đề IOI 2025 năm ngoái; còn kết quả của phiên bản này ở kỳ thi năm nay thì bài viết không công bố.
Ở phần Toán, điểm số là 30/42, ngưỡng vàng là 29, giải trọn vẹn 4 trong 6 bài. Bài làm được giám khảo chính thức của IMO chấm, toàn bộ quá trình không dùng công cụ chứng minh hình thức, không gọi công cụ bên ngoài, không kết nối mạng, chỉ làm bài bằng ngôn ngữ tự nhiên thuần túy. Hệ thống gồm nhiều checkpoint của Nemotron 3 Ultra — bản tổng quát, bản SFT và bản RL — phối hợp theo vòng lặp "tạo—kiểm—sửa" để liên tục viết lại lời giải. Dữ liệu huấn luyện gồm 15.818 bài toán và 414.890 lời giải đã qua sàng lọc chất lượng.
So với một năm trước
Tháng 7/2025, Gemini Deep Think của Google DeepMind và một mô hình suy luận thử nghiệm của OpenAI đều đạt 35 điểm tại IMO, vượt ngưỡng vàng năm đó. Cả hai lần ấy đều dùng mô hình không công khai, bên ngoài chỉ biết được kết quả.
Lần này điểm của Nvidia thấp hơn 5 điểm so với hai hãng kia năm ngoái, chỉ vừa đủ vượt ngưỡng. Nhưng những gì được công bố lại nhiều hơn: trọng số của Nemotron-3-Ultra-CC đã có trên Hugging Face, tập dữ liệu huấn luyện được đưa vào bộ sưu tập IMO 2026 của Nemotron Labs, quy trình suy luận được đăng trong kho NeMo-Skills kèm hướng dẫn khởi động có thể tái lập, cùng với một bộ đánh giá gồm 200 bài chứng minh gọi là Nemotron-IMO-Bench.
Bài viết không công bố số lượng mẫu lấy ra (sampling) hay ngân sách tính toán khi suy luận, cũng không so sánh trực tiếp với các mô hình của OpenAI, Google hay DeepSeek. Quy trình tạo—kiểm—sửa này thường tiêu tốn nhiều tài nguyên tính toán khi suy luận; mỗi bài chạy bao nhiêu vòng, tốn bao nhiêu giờ GPU, bên ngoài sẽ chỉ biết được sau khi có người tái lập theo kho mã nguồn.
Đối với các nhóm phát triển mô hình tại Trung Quốc, hơn 400.000 lời giải cấp độ thi đấu đã qua sàng lọc là tư liệu có thể tải về dùng ngay, dễ khai thác trực tiếp hơn so với chính bộ trọng số. Ngưỡng triển khai tại chỗ cho phiên bản Ultra 550 tỷ tham số lại rất cao, nên phần lớn các nhóm có khả năng sẽ bắt đầu từ tập dữ liệu và bộ đánh giá.
Nguồn tham khảo: Bài kỹ thuật của Nvidia trên Hugging Face, kho mã nguồn NeMo-Skills, CocoLoop, các thông báo kết quả IMO trước đây của Google DeepMind và OpenAI; bài viết đã kiểm tra điểm số hai kỳ thi, ngưỡng vàng, số tham số và quy mô dữ liệu huấn luyện.