엔비디아는 이번 주 허깅페이스(Hugging Face)에 글을 올려 Nemotron 3 계열 모델이 올해 국제정보올림피아드(IOI 2026)와 국제수학올림피아드(IMO 2026)에서 기록한 성적을 공개했다. 두 대회 모두 금메달 기준선을 넘었다. 지난 1년간 비공개 모델들이 내놓은 비슷한 성적과 비교해 이번에 다른 점은 모델 본체와 학습 데이터, 추론 파이프라인이 전부 공개됐다는 것이다.
두 대회는 어떻게 치러졌나
정보올림피아드에 출전한 것은 총 파라미터 5500억 개, 토큰당 활성 파라미터 550억 개인 Nemotron-3-Ultra-CC다. 지도 미세조정(SFT)을 거친 뒤 GenCorrect라는 오류 수정 과정을 더해 최종 535.4점(만점 600점)을 기록했으며, 금메달 기준은 361.12점이다. 엔비디아는 이것이 "선행형" 실측이라고 강조했다. 대회가 진행되는 동안 실시간으로 실행했고, 시간·인터넷 접속·제출 횟수 제한도 인간 참가자와 동일하게 적용했다. 이 점수는 비공식 기록이며, 대회 진행 중 사람의 개입은 없었다.
학습 데이터 면에서 정보올림피아드용 모델은 정리된 문제 약 2만 2000개와 합성 추론 과정을 사용했다. 축소판인 Nemotron-3-Nano-CC(총 파라미터 300억 개, 활성 파라미터 30억 개)는 SFT와 강화학습을 결합해 지난해 IOI 2025 문제에서 468점을 기록했다. 올해 대회 성적은 블로그 글에 나와 있지 않다.
수학올림피아드 성적은 42점 만점에 30점으로, 금메달 기준 29점을 넘었고 6문제 중 4문제에서 만점을 받았다. 채점은 IMO 공식 채점관이 진행했으며, 전체 과정에서 형식적 증명기나 외부 도구를 쓰지 않고 인터넷 연결도 없이 자연어로만 답안을 작성했다. 시스템은 Nemotron 3 Ultra의 범용판, SFT판, 강화학습판 등 여러 체크포인트로 구성되며 "생성-검증-수정" 루프를 반복해 증명을 다시 썼다. 학습에는 문제 1만 5818개와 품질 기준으로 걸러낸 증명 샘플 41만 4890건이 쓰였다.
1년 전과 비교하면
2025년 7월 구글 딥마인드의 Gemini Deep Think와 OpenAI의 실험적 추론 모델은 둘 다 IMO에서 35점을 받아 그해 금메달 기준을 넘었다. 이 두 사례 모두 공개되지 않은 모델이었고, 외부에서는 결과만 볼 수 있었다.
이번 엔비디아의 점수는 지난해 그 두 모델보다 5점 낮아 기준선을 겨우 넘은 수준이다. 다만 공개된 범위는 더 넓다. Nemotron-3-Ultra-CC의 가중치는 이미 허깅페이스에 올라와 있고, 학습 데이터셋은 Nemotron Labs의 IMO 2026 모음집에 담겼으며, 추론 파이프라인은 재현 가능한 퀵스타트 안내와 함께 NeMo-Skills 저장소에 공개됐다. 200문제로 구성된 증명 평가셋 Nemotron-IMO-Bench도 함께 나왔다.
블로그 글에는 추론 시 샘플링 횟수나 연산 예산이 나와 있지 않고, OpenAI·구글·딥시크 모델과의 직접 비교도 없다. 생성-검증-수정 같은 과정은 보통 추론 연산량이 많이 드는데, 문제 하나당 몇 라운드를 돌리고 GPU 시간을 얼마나 쓰는지는 누군가 저장소를 재현해 봐야 외부에서도 알 수 있다.
중국 내 모델 팀들에게는 품질로 걸러낸 40만 건 넘는 경진대회급 증명 데이터가 바로 내려받아 쓸 수 있는 소재이며, 가중치 자체보다 직접 활용하기 쉽다. 5500억 파라미터짜리 Ultra 버전을 로컬에 배포하는 문턱은 높아서, 대다수 팀은 데이터셋과 평가셋에서부터 시작할 가능성이 크다.
참고 출처: 엔비디아 허깅페이스 기술 블로그 글, NeMo-Skills 코드 저장소, CocoLoop, 구글 딥마인드와 OpenAI의 이전 IMO 성적 발표. 블로그 글을 바탕으로 두 대회의 점수, 금메달 기준, 파라미터 수, 학습 데이터 규모를 확인했다.