NVIDIA ha presentato Nemotron 3 Ultra, il modello più imponente della famiglia Nemotron 3, progettato specificamente per ottimizzare il funzionamento di agenti IA a lunga esecuzione che richiedono pianificazione, chiamate a strumenti e ragionamenti complessi su contesti estesi.

550B
Parametri Totali
Architettura Mixture-of-Experts
1M
Finestra di Contesto
Token gestiti contemporaneamente
~6x
Throughput
Rispetto a LLM open di pari categoria
20T
Token di Training
Dataset di pre-addestramento

Che cos'è Nemotron 3 Ultra

Nemotron 3 Ultra è un modello Mixture-of-Experts (MoE) da 550 miliardi di parametri totali, di cui solo 55 miliardi sono attivi per ogni singolo token. Il design MoE — una tecnica che attiva solo una frazione del "cervello" del modello per rispondere a un input — permette di migliorare l'accuratezza senza far esplodere i costi computazionali durante l'inferenza.

A differenza dei tradizionali Transformer, Nemotron 3 Ultra adotta un'architettura ibrida Mamba-Attention. Gli strati Mamba (una struttura di tipo State Space Model) gestiscono le lunghe sequenze con una scalabilità sub-quadratica, riducendo drasticamente il carico di memoria. Al contempo, vengono mantenuti alcuni strati di Attention per garantire un richiamo preciso delle informazioni (recall) anche su contesti massivi.

Architettura e prestazioni di NVIDIA Nemotron 3 Ultra
Schema tecnico dell'architettura ibrida di Nemotron 3 Ultra presentata da NVIDIA il 04 giugno 2026.

Il modello è stato pre-addestrato su 20 trilioni (20.000 miliardi) di token di testo, con una finestra di contesto successivamente estesa fino a 1 milione di token. NVIDIA riporta un throughput (velocità di elaborazione dei dati) fino a circa 6 volte superiore rispetto a modelli open-source comparabili, mantenendo un'accuratezza equivalente.

Innovazioni dell'architettura ibrida

Il modello presenta 108 strati con una dimensione interna di 8.192. Utilizza 64 testine di query e solo 2 testine key-value, una configurazione che mantiene estremamente ridotta la cache KV (la memoria temporanea usata per ricordare i token precedenti). Ogni strato MoE ospita 512 "esperti", con i migliori 22 attivati per ogni token.

Tre scelte progettuali definiscono l'efficienza di questo modello:

  • LatentMoE: Un sistema di instradamento degli esperti più efficiente. Sacrificando parte della larghezza della dimensione nascosta, permette di consultare più esperti a parità di costo computazionale, migliorando l'accuratezza per singolo parametro.
  • Multi-Token Prediction (MTP): Questa tecnica prevede diversi token futuri in un unico passaggio in avanti (forward pass). Abilita nativamente il decoding speculativo, accelerando la generazione del testo.
  • Pre-training in NVFP4: Utilizza il tipo di dato a 4 bit (E2M1) con quantizzazione a blocchi bidimensionale. Si tratta della più vasta dimostrazione su scala industriale di un addestramento stabile e accurato in formato FP4 (virgola mobile a 4 bit).

Addestramento e rilascio dei dati

L'addestramento è stato suddiviso in due fasi principali. I primi 15 trilioni di token sono stati selezionati per massimizzare la diversità dei contenuti, mentre gli ultimi 5 trilioni si sono concentrati su dati di altissima qualità. NVIDIA ha inoltre rilasciato nuovi dataset specifici per dominio, inclusi 173 miliardi di token di codice GitHub aggiornati al 30 settembre 2025.

Il processo di post-addestramento ha aggiunto 10 milioni di campioni per il Supervised Fine-Tuning (SFT) e 1 milione di nuovi compiti per il Reinforcement Learning (RL). In totale, l'ecosistema Nemotron offre ora 50 milioni di campioni SFT e 55 ambienti di apprendimento per rinforzo.

Durante lo sviluppo sono state documentate due divergenze nella perdita (loss divergences). La prima, intorno agli 8 trilioni di token, è stata risolta riportando la riduzione del gradiente dello strato di output da BF16 a FP32. La seconda, a 16 trilioni di token, è stata mitigata anticipando il processo di annealing (riduzione graduale) del tasso di apprendimento.

Pipeline di Post-Training: MOPD e RLVR

NVIDIA ha introdotto il metodo Multi-teacher On-Policy Distillation (MOPD) per raffinare le capacità del modello. Poiché l'addestramento in ambienti misti tende a diluire i segnali di apprendimento, NVIDIA ha addestrato oltre dieci modelli "insegnanti" specializzati in singoli domini (codice, matematica, sicurezza, ecc.).

Il modello "studente" genera le proprie soluzioni (rollouts), che vengono valutate dall'insegnante competente con una guida densa a livello di singolo token. Questo segnale è molto più ricco rispetto alle ricompense sparse del metodo RLVR (Reinforcement Learning with Verifiable Reward).

Prestazioni e Benchmarking

Nemotron 3 Ultra si confronta direttamente con giganti come GLM-5.1 (754B) e Kimi-K2.6 (1T). Nei compiti legati agli agenti, ha ottenuto 90,0 su PinchBench e 56,0 su ProfBench. Nel campo dell'ingegneria del software, il punteggio su SWE-Bench Verified è di 71,9.

Confronto Throughput (8K in / 64K out)
Mostra dati
Confronto Throughput (8K in / 64K out)
VoceMoltiplicatore Velocità
GLM-5.11
Kimi-K2.61,22
Qwen-3.53,68
Nemotron 3 Ultra5,9
Fonte: NVIDIA Technical Report

Un dato rilevante riguarda la resistenza alle allucinazioni: su AA-Omniscience, il modello ha registrato il punteggio più alto nel set di confronto (78,7), dimostrando una minore tendenza a fornire risposte incerte o inventate. Per quanto riguarda il contesto lungo, mantiene un punteggio di 94,7 su RULER con 1 milione di token.

Pro
  • Throughput fino a 5,9x superiore su sequenze lunghe
  • Gestione nativa di 1 milione di token di contesto
  • Licenza open per pesi, dati e ricette di addestramento
  • Alta precisione nei compiti di ragionamento per agenti
Contro
  • Costi di pre-elaborazione (prefill) più alti rispetto a modelli con meno parametri attivi
  • Necessita di hardware Blackwell per sfruttare appieno il formato FP4

Quantizzazione e Distribuzione

Il modello viene distribuito come un singolo checkpoint NVFP4. Sull'architettura NVIDIA Blackwell, opera con matematica FP4 nativa. Sull'architettura Hopper, viene eseguito in modalità W4A16 (pesi a 4 bit e attivazioni a 16 bit), poiché Hopper non dispone di Tensor Core FP4 nativi.

La soluzione finale opera a 5,03 bit per elemento, mescolando esperti in formato NVFP4 con strati in FP8 per gli esperti condivisi e strati Attention in BF16. Questa configurazione permette di far risiedere i pesi MTP su un singolo nodo H100 con 8 GPU, ottimizzando lo spazio di memoria rispetto a un formato FP8 completo.

Il nostro verdetto
4.8/ 5

Il nuovo standard per gli agenti open

NVIDIA Nemotron 3 Ultra non è solo un modello di grandi dimensioni, ma un esercizio di efficienza architettonica. La scelta dell'ibrido Mamba-Attention e la quantizzazione NVFP4 lo rendono lo strumento più avanzato oggi disponibile per chi sviluppa agenti IA complessi che devono operare su contesti lunghi senza costi di inferenza proibitivi.

Cosa significa architettura ibrida Mamba-Attention?
È una combinazione di strati Mamba, che gestiscono le lunghe sequenze con efficienza lineare, e strati di Attention, che garantiscono la precisione nel recupero delle informazioni. Questo mix riduce il consumo di memoria KV cache.
Il modello è realmente open source?
È rilasciato sotto licenza OpenMDW-1.1, che permette l'uso dei pesi, dei dataset di addestramento e delle metodologie (ricette) utilizzate da NVIDIA.
Su quale hardware può essere eseguito?
È ottimizzato per NVIDIA Blackwell (FP4 nativo) e Hopper (W4A16). Può essere eseguito anche su architetture Ampere, sebbene con prestazioni inferiori rispetto alle generazioni più recenti.
Cos'è il metodo MOPD?
Il Multi-teacher On-Policy Distillation è una tecnica dove diversi modelli esperti (insegnanti) guidano l'apprendimento di un singolo modello studente, fornendo feedback dettagliati su ogni parola generata durante l'addestramento.

Fonti e riferimenti

  1. NVIDIA Nemotron 3 Ultra Technical Report
  2. Hugging Face - NVIDIA Nemotron 3 Ultra 550B
  3. NVIDIA Developer Blog - Nemotron 3 Ultra Technical Details