NVIDIA svela Nemotron 3 Ultra: un colosso AI da 550 miliardi di parametri per agenti autonomi
NVIDIA ha rilasciato Nemotron 3 Ultra, il modello più grande della famiglia Nemotron 3, con 550 miliardi di parametri totali e 55 miliardi attivi per token. Il modello è progettato per un problema specifico: agenti AI che pianificano, chiamano strumenti e ragionano su molte interazioni consecutive, dove i costi di inferenza crescono con la lunghezza delle sequenze.
L’architettura è un Mixture-of-Experts (MoE) ibrido Mamba-Attention. I layer Mamba gestiscono sequenze lunghe con scalabilità sub-quadratica, mentre alcuni layer di attenzione sono mantenuti per la precisione su contesti estesi. Il modello è stato pre-addestrato su 20 trilioni di token di testo, con contesto esteso a 1 milione di token, e post-addestrato con SFT, RL e una nuova tecnica chiamata Multi-teacher On-Policy Distillation (MOPD). NVIDIA dichiara fino a 6x throughput di inferenza rispetto a modelli open comparabili, a parità di accuratezza.
Architettura e design
Il modello ha 108 layer e dimensione di 8.192. Usa 64 query head ma solo 2 key-value head, tenendo la cache KV piccola. Ogni layer MoE contiene 512 esperti, con i migliori 22 attivati per token. Tre scelte progettuali spiccano:
- LatentMoE: instrada gli esperti in modo più efficiente, scambiando larghezza della dimensione nascosta per più esperti instradati a costo fisso. NVIDIA riporta migliore accuratezza per parametro rispetto alle granular MoE standard.
- Multi-Token Prediction (MTP): prevede più token futuri in un singolo forward pass, abilitando decodifica speculativa nativa per generazione più veloce.
- NVFP4 pre-training: usa il datatype E2M1 a 4 bit con quantizzazione a blocchi bidimensionale sui pesi. NVIDIA lo chiama la più grande dimostrazione di addestramento NVFP4 stabile e accurato fino ad oggi.
Addestramento e dati
L’addestramento ha usato uno scheduling Warmup-Stable-Decay su 20 trilioni di token, suddiviso in due fasi: i primi 15 trilioni orientati alla diversità, gli ultimi 5 trilioni a dati di alta qualità. NVIDIA ha rilasciato nuovi dataset di pre-addestramento specifici per dominio, tra cui 173 miliardi di token di codice GitHub. In un’ablation su Nemotron 3 Nano, un dataset sintetico legale ha alzato la media proxy LegalBench da 64,6 a 74,7; un dataset fact-seeking basato su Wikipedia ha alzato proxy SimpleQA da 40,2 a 50,2.
Il post-addestramento include 10 milioni di nuovi campioni SFT, 1 milione di nuovi task RL e 15 nuovi ambienti RL. I totali cumulativi aperti di Nemotron raggiungono 50 milioni di campioni SFT, 2 milioni di task RL e 55 ambienti RL.
L’addestramento non è stato privo di problemi. NVIDIA documenta due divergenze di loss. La prima, vicino a 8 trilioni di token, è stata causata dallo spostamento della riduzione del gradiente del livello di output da FP32 a BF16: il contributo del gradiente MTP veniva perso nei 7 bit di mantissa di BF16. Tornare a FP32 ha risolto. La seconda, vicino a 16 trilioni di token, non ha una causa confermata; NVIDIA ha mitigato riducendo il learning rate in anticipo e tagliando l’orizzonte a 20 trilioni di token.
Post-training: SFT, RLVR e MOPD
La pipeline di post-addestramento esegue SFT, poi RLVR unificato, poi riscaldamento MOPD, MOPD e potenziamento MTP. L’intero ciclo può ripetersi per diverse iterazioni. RLVR (Reinforcement Learning with Verifiable Reward) addestra su molti ambienti contemporaneamente: uso del terminale, ingegneria del software, ricerca, matematica, codice, sicurezza e altro. La ricompensa in questi contesti è spesso sparsa e dipendente dall’ambiente.
MOPD (Multi-teacher On-Policy Distillation) è il nuovo metodo principale. Poiché RLVR in ambienti misti diluisce il segnale di apprendimento all’aumentare del numero di ambienti, NVIDIA ha addestrato più di dieci modelli insegnante specializzati per dominio. Durante MOPD, il modello studente genera i propri rollout attraverso i domini; ogni rollout viene valutato dall’insegnante corrispondente con guida densa a livello di token. NVIDIA ha eseguito due iterazioni MOPD per Nemotron 3 Ultra.
Controllo dello sforzo di ragionamento
Nemotron 3 Ultra supporta tre modalità di ragionamento: reasoning-off, regular e medium-effort. Le modalità regular e medium accettano anche un controllo del budget al momento dell’inferenza. La modalità medium-effort usa circa 2,5x meno token della modalità regular, con un calo di accuratezza di circa il 7% — un compromesso utile per passaggi ad alto volume.
Benchmark e prestazioni
Nei confronti con modelli come GLM-5.1 (754B), Kimi-K2.6 (1T) e Qwen-3.5 (397B), Nemotron 3 Ultra si posiziona in modo competitivo. Su compiti agentici ottiene 90,0 su PinchBench e 56,0 su ProfBench (Search). Segna 71,9 su SWE-Bench Verified e 56,4 su Terminal Bench 2.1 (Kimi-K2.6 guida a 67,2). Su ragionamento ottiene 570,0 su IOI 2025, descritto da NVIDIA come programmazione competitiva a livello top-3 umano. Su AA-Omniscience ha il punteggio di non-allucinazione più alto del set, 78,7, indicando una minore tendenza a rispondere quando incerto.
Il contesto lungo regge: 94,7 su RULER a 1 milione di token. Diversi modelli di confronto più grandi sono limitati a 256K di contesto. In una configurazione 8K input / 64K output su GB200 con NVFP4, Nemotron 3 Ultra raggiunge 5,9x il throughput di GLM-5.1, 4,8x più veloce di Kimi-K2.6 e 1,6x più veloce di Qwen-3.5 (nota: Nemotron usa TRT-LLM, gli altri vLLM). Su carichi prefill-heavy (50K input / 2K output) è in svantaggio su Qwen-3.5.
NVIDIA riporta anche un costo per completamento del task fino al 30% inferiore, da meno token per turno su SWE-Bench e Terminal Bench.
Quantizzazione e deployment
NVIDIA distribuisce un singolo checkpoint NVFP4. Su Blackwell funziona con math FP4 nativa; su Hopper come W4A16, dato che Hopper manca di tensor core FP4 nativi. La soluzione finale opera a 5,03 bit per elemento, mescolando esperti instradati NVFP4 con layer FP8 per esperti condivisi e lineari Mamba. I layer di attenzione restano in BF16. Il peso ridotto permette di far stare i pesi MTP su un singolo nodo a 8 GPU H100, cosa che un checkpoint FP8 non potrebbe senza estendersi su due nodi.
