I chatbot tradizionali stanno evolvendo in agenti a lunga durata capaci di ragionare, mantenere il contesto e utilizzare strumenti complessi per completare workflow articolati. NVIDIA Nemotron 3 Ultra si inserisce in questo scenario come un modello Mixture-of-Experts (MoE) da 550 miliardi di parametri, progettato specificamente per orchestrare sistemi multi-agente con un'efficienza senza precedenti.

Orchestrazione di agenti: oltre la singola interazione
In un workflow basato su agenti, il numero di token — le unità base di testo elaborate dall'AI — cresce rapidamente. Gli agenti devono pianificare, richiamare strumenti, invocare sub-agenti e analizzare costantemente la cronologia delle azioni. Questo processo iterativo aumenta i costi e il rischio di "drift" (deriva), dove l'AI perde di vista l'obiettivo finale.
Nemotron 3 Ultra affronta queste sfide gestendo le "chiamate difficili": decisioni architettoniche in sessioni di programmazione, sintesi di fonti di ricerca contraddittorie o verifica di design di chip con migliaia di vincoli. Il modello utilizza un'architettura Mixture-of-Experts (MoE), una tecnica che attiva solo una frazione dei parametri (55 miliardi su 550) per ogni richiesta, garantendo alta precisione con un consumo computazionale ottimizzato.
| Benchmark (Area) | Nemotron 3 Ultra (550B) | GLM 5.1 (744B) | Kimi K2.6 (1T) | Qwen3.5 (397B) |
|---|---|---|---|---|
| Productivity (PinchBench) | 91% | 84% | 91% | 89% |
| Planning (EnterpriseOps) | 33% | 40% | 29% | 30% |
| Coding (Terminal-Bench 2.0) | 54% | 64% | 67% | 53% |
| Instruction Following (IFBench) | 82% | 77% | 74% | 78% |
| Long Context (Ruler @1M) | 95% | N/A | N/A | 90% |
Innovazioni architettoniche per il throughput elevato
Per superare i limiti dei modelli tradizionali, NVIDIA ha introdotto diverse innovazioni tecniche che permettono a Nemotron 3 Ultra di raggiungere un throughput (velocità di generazione) fino a 5 volte superiore rispetto alla concorrenza:
- Hybrid Mamba-Transformer: combina i layer Mamba, efficienti nella gestione di lunghe sequenze, con i layer Transformer, necessari per mantenere una memoria precisa dei fatti nel contesto.
- Precisione NVFP4: un formato di quantizzazione (riduzione della precisione numerica per risparmiare memoria) che permette al modello di girare su architetture NVIDIA Hopper, Blackwell e Ampere con un unico checkpoint, garantendo prestazioni elevate senza perdita di accuratezza.
- Multi-token prediction (MTP): permette al modello di prevedere più token futuri in un singolo passaggio, riducendo drasticamente i tempi di generazione per output lunghi.
- LatentMoE: ottimizza il routing (lo smistamento) delle richieste verso gli "esperti" più qualificati all'interno del modello, migliorando la gestione di logiche specifiche come il codice o i richiami a strumenti esterni.
Mostra dati
| Voce | Punteggio relativo |
|---|---|
| Nemotron 3 Ultra (Velocità) | 100 |
| Modelli Open Classe 400B+ (Velocità) | 20 |
| Nemotron 3 Ultra (Accuratezza) | 91 |
| Modelli Open Classe 400B+ (Accuratezza) | 88 |
Multi-Teacher On-Policy Distillation (MOPD)
Il processo di addestramento di Nemotron 3 Ultra si basa sulla MOPD, una tecnica di distillazione dove il modello "studente" impara simultaneamente da oltre 10 modelli "insegnanti" specializzati in domini diversi (legale, codice, ragionamento logico).
Durante questo addestramento iterativo, gli insegnanti valutano i tentativi dello studente in tempo reale. Questo co-sviluppo permette una specializzazione progressiva e prestazioni superiori su benchmark come SWE-bench Verified, dove il modello raggiunge punteggi tra il 65% e il 70,4%.
Dati di addestramento e specializzazione settoriale
Oltre alle capacità di ragionamento, NVIDIA ha arricchito il dataset di pre-training (già basato su 10 trilioni di token) con 212 miliardi di token aggiuntivi focalizzati su aree ad alto valore:
- 4 miliardi di token legali sintetici: hanno innalzato le prestazioni su LegalBench dal 64,6% al 74,7%.
- 35 miliardi di token basati su Wikipedia: per migliorare la conoscenza enciclopedica e ridurre le allucinazioni.
- 173 miliardi di token GitHub aggiornati: con dati fino al 30 settembre 2025, per garantire la massima competenza nelle librerie software più recenti.
Sicurezza e interazione vocale: i modelli complementari
Insieme a Ultra, NVIDIA ha rilasciato due modelli specializzati per compiti verticali:
- Nemotron 3.5 Content Safety: un modello da 4 miliardi di parametri che funge da guardrail (protezione) per identificare contenuti non sicuri o violazioni di policy in 12 lingue e 23 categorie di rischio.
- Nemotron 3.5 ASR: un modello di riconoscimento vocale multilingue (40+ lingue) progettato per la bassa latenza (sotto i 100 ms), ideale per agenti vocali che devono rispondere in tempo reale.
Il nuovo standard per l’AI Agentica
NVIDIA Nemotron 3 Ultra non è solo un modello più grande, ma un sistema pensato per la produzione. La combinazione di velocità estrema, precisione sui lunghi contesti e un ecosistema di strumenti di sicurezza lo rende la scelta primaria per chi sviluppa agenti autonomi complessi.




