NVIDIA ha presentato Nemotron 3 Ultra, il modello più imponente della famiglia Nemotron 3, progettato specificamente per ottimizzare il funzionamento di agenti IA a lunga esecuzione che richiedono pianificazione, chiamate a strumenti e ragionamenti complessi su contesti estesi.
Che cos'è Nemotron 3 Ultra
Nemotron 3 Ultra è un modello Mixture-of-Experts (MoE) da 550 miliardi di parametri totali, di cui solo 55 miliardi sono attivi per ogni singolo token. Il design MoE — una tecnica che attiva solo una frazione del "cervello" del modello per rispondere a un input — permette di migliorare l'accuratezza senza far esplodere i costi computazionali durante l'inferenza.
A differenza dei tradizionali Transformer, Nemotron 3 Ultra adotta un'architettura ibrida Mamba-Attention. Gli strati Mamba (una struttura di tipo State Space Model) gestiscono le lunghe sequenze con una scalabilità sub-quadratica, riducendo drasticamente il carico di memoria. Al contempo, vengono mantenuti alcuni strati di Attention per garantire un richiamo preciso delle informazioni (recall) anche su contesti massivi.

Il modello è stato pre-addestrato su 20 trilioni (20.000 miliardi) di token di testo, con una finestra di contesto successivamente estesa fino a 1 milione di token. NVIDIA riporta un throughput (velocità di elaborazione dei dati) fino a circa 6 volte superiore rispetto a modelli open-source comparabili, mantenendo un'accuratezza equivalente.
Innovazioni dell'architettura ibrida
Il modello presenta 108 strati con una dimensione interna di 8.192. Utilizza 64 testine di query e solo 2 testine key-value, una configurazione che mantiene estremamente ridotta la cache KV (la memoria temporanea usata per ricordare i token precedenti). Ogni strato MoE ospita 512 "esperti", con i migliori 22 attivati per ogni token.
Tre scelte progettuali definiscono l'efficienza di questo modello:
- LatentMoE: Un sistema di instradamento degli esperti più efficiente. Sacrificando parte della larghezza della dimensione nascosta, permette di consultare più esperti a parità di costo computazionale, migliorando l'accuratezza per singolo parametro.
- Multi-Token Prediction (MTP): Questa tecnica prevede diversi token futuri in un unico passaggio in avanti (forward pass). Abilita nativamente il decoding speculativo, accelerando la generazione del testo.
- Pre-training in NVFP4: Utilizza il tipo di dato a 4 bit (E2M1) con quantizzazione a blocchi bidimensionale. Si tratta della più vasta dimostrazione su scala industriale di un addestramento stabile e accurato in formato FP4 (virgola mobile a 4 bit).
Addestramento e rilascio dei dati
L'addestramento è stato suddiviso in due fasi principali. I primi 15 trilioni di token sono stati selezionati per massimizzare la diversità dei contenuti, mentre gli ultimi 5 trilioni si sono concentrati su dati di altissima qualità. NVIDIA ha inoltre rilasciato nuovi dataset specifici per dominio, inclusi 173 miliardi di token di codice GitHub aggiornati al 30 settembre 2025.
Il processo di post-addestramento ha aggiunto 10 milioni di campioni per il Supervised Fine-Tuning (SFT) e 1 milione di nuovi compiti per il Reinforcement Learning (RL). In totale, l'ecosistema Nemotron offre ora 50 milioni di campioni SFT e 55 ambienti di apprendimento per rinforzo.
Durante lo sviluppo sono state documentate due divergenze nella perdita (loss divergences). La prima, intorno agli 8 trilioni di token, è stata risolta riportando la riduzione del gradiente dello strato di output da BF16 a FP32. La seconda, a 16 trilioni di token, è stata mitigata anticipando il processo di annealing (riduzione graduale) del tasso di apprendimento.
Pipeline di Post-Training: MOPD e RLVR
NVIDIA ha introdotto il metodo Multi-teacher On-Policy Distillation (MOPD) per raffinare le capacità del modello. Poiché l'addestramento in ambienti misti tende a diluire i segnali di apprendimento, NVIDIA ha addestrato oltre dieci modelli "insegnanti" specializzati in singoli domini (codice, matematica, sicurezza, ecc.).
Il modello "studente" genera le proprie soluzioni (rollouts), che vengono valutate dall'insegnante competente con una guida densa a livello di singolo token. Questo segnale è molto più ricco rispetto alle ricompense sparse del metodo RLVR (Reinforcement Learning with Verifiable Reward).
Prestazioni e Benchmarking
Nemotron 3 Ultra si confronta direttamente con giganti come GLM-5.1 (754B) e Kimi-K2.6 (1T). Nei compiti legati agli agenti, ha ottenuto 90,0 su PinchBench e 56,0 su ProfBench. Nel campo dell'ingegneria del software, il punteggio su SWE-Bench Verified è di 71,9.
Mostra dati
| Voce | Moltiplicatore Velocità |
|---|---|
| GLM-5.1 | 1 |
| Kimi-K2.6 | 1,22 |
| Qwen-3.5 | 3,68 |
| Nemotron 3 Ultra | 5,9 |
Un dato rilevante riguarda la resistenza alle allucinazioni: su AA-Omniscience, il modello ha registrato il punteggio più alto nel set di confronto (78,7), dimostrando una minore tendenza a fornire risposte incerte o inventate. Per quanto riguarda il contesto lungo, mantiene un punteggio di 94,7 su RULER con 1 milione di token.
- ✓Throughput fino a 5,9x superiore su sequenze lunghe
- ✓Gestione nativa di 1 milione di token di contesto
- ✓Licenza open per pesi, dati e ricette di addestramento
- ✓Alta precisione nei compiti di ragionamento per agenti
- ✗Costi di pre-elaborazione (prefill) più alti rispetto a modelli con meno parametri attivi
- ✗Necessita di hardware Blackwell per sfruttare appieno il formato FP4
Quantizzazione e Distribuzione
Il modello viene distribuito come un singolo checkpoint NVFP4. Sull'architettura NVIDIA Blackwell, opera con matematica FP4 nativa. Sull'architettura Hopper, viene eseguito in modalità W4A16 (pesi a 4 bit e attivazioni a 16 bit), poiché Hopper non dispone di Tensor Core FP4 nativi.
La soluzione finale opera a 5,03 bit per elemento, mescolando esperti in formato NVFP4 con strati in FP8 per gli esperti condivisi e strati Attention in BF16. Questa configurazione permette di far risiedere i pesi MTP su un singolo nodo H100 con 8 GPU, ottimizzando lo spazio di memoria rispetto a un formato FP8 completo.
Il nuovo standard per gli agenti open
NVIDIA Nemotron 3 Ultra non è solo un modello di grandi dimensioni, ma un esercizio di efficienza architettonica. La scelta dell'ibrido Mamba-Attention e la quantizzazione NVFP4 lo rendono lo strumento più avanzato oggi disponibile per chi sviluppa agenti IA complessi che devono operare su contesti lunghi senza costi di inferenza proibitivi.
