NVIDIA 開源 Nemotron 3 全系列及訓練資料

黃仁勳要在開源模型市場插一面旗

大家以為 NVIDIA 只管賣 GPU 的時候,NVIDIA 悄悄發布了 Nemotron 3 全系列——不只是模型權重,連 3 兆 token 的預訓練資料集、強化學習流程和評估工具全部開源了

這個動作的信號很清晰:NVIDIA 不想只做賣鏟子的,它要在開源 AI 生態裡占一個位置。

三個尺寸,全部混合專家架構

Nemotron 3 系列採用的是混合潛空間 MoE(Hybrid Latent MoE)架構,共三個版本:

型號總參數每次激活參數狀態
Nano300 億約 30 億已發布
Super約 1000 億約 100 億2026 上半年
Ultra約 5000 億約 500 億2026 上半年

MoE 的核心優勢就是:參數規模大,但每次推理只激活一小部分,所以實際計算成本可以控制得住。DeepSeek V3、Llama 4 都在用同樣的思路,現在 NVIDIA 也跟上了。

Nano 的跑分數據挺有意思

已發布的 Nano 版本,官方給出的數據:

  • 推理速度是前代產品的 4 倍
  • 推理 token 生成量減少 60%(能用更少的中間步驟得到結論)
  • 上下文視窗 1M token

第三方評測機構 Artificial Analysis 的評價是:「同尺寸模型裡開放程度最高、效率最好的,精度也領先」。

這個「高效推理」方向和 DeepSeek V3.2 的稀疏注意力思路有點像——大方向都是在不犧牲效果的前提下把計算量打下來。

全開放的工具鏈

NVIDIA 同步開源了一套配套工具:

  • NeMo Gym:Agent 強化學習訓練框架
  • NeMo RL:強化學習流程庫
  • NeMo Evaluator:評估工具

模型權重、訓練資料、工具鏈全部發在 Hugging Face 和 GitHub 上,協議完全開放,任何人可以下載、微調、部署。

NVIDIA 為什麼要做這件事

有幾個可能的邏輯:

軟體綁定硬體。你用 NVIDIA 的開源模型工具鏈,大概率配 NVIDIA 的 GPU 跑。這和當年 CUDA 的邏輯一樣,用生態鎖住計算基礎設施。

對沖開源競爭壓力。DeepSeek、Llama 4、Qwen 這些開源模型越來越強,NVIDIA 如果只做硬體層,在 AI 生態的話語權會被稀釋。做開源模型等於直接入局。

企業採購捆綁。很多大企業買 NVIDIA GPU 加服務套餐,內置可信的開源模型是加分項,也是銷售材料的一部分。

當然,開源這件事對 NVIDIA 來說也是成本。但從 NVIDIA 目前的財力來看,這不是問題。

值得等的是 Super 和 Ultra

目前發布的 Nano 規模相對保守。真正讓人期待的是 2026 上半年的 Super(1000 億參數)和 Ultra(5000 億參數)——如果 Nemotron 3 Ultra 打出來的 benchmark 夠好,這件事就不只是「NVIDIA 也做模型了」這麼簡單,而是一個在開源模型排行榜上有真實競爭力的選手。

參考來源:CocoLoop、NVIDIA Debuts Nemotron 3 Family of Open Models(NVIDIA Newsroom)