---
title: "NVIDIA Nemotron 3 Ultra: l'IA ibrida che rivoluziona gli agenti"
date: "2026-06-04"
category: "Tecnologia"
tags: ["deep learning", "intelligenza artificiale", "mamba", "nemotron", "nvidia"]
author: "Giuseppe Carruezzo"
description: "Scopri NVIDIA Nemotron 3 Ultra: modello MoE ibrido Mamba-Attention da 550B parametri, ottimizzato per agenti IA complessi e contesti da 1 milione di token."
source: "https://ainsights.it/blog/nvidia-nemotron-3-ultra-rivoluzione-ia"
---

# NVIDIA Nemotron 3 Ultra: l'IA ibrida che rivoluziona gli agenti

![NVIDIA Nemotron 3 Ultra: l'IA ibrida che rivoluziona gli agenti](/blogai/backend/uploads/6a2205d55f0d5.webp)

NVIDIA ha presentato Nemotron 3 Ultra, il modello più imponente della famiglia Nemotron 3, progettato specificamente per ottimizzare il funzionamento di agenti IA a lunga esecuzione che richiedono pianificazione, chiamate a strumenti e ragionamenti complessi su contesti estesi.

-   **550B** — Parametri Totali (Architettura Mixture-of-Experts)
-   **1M** — Finestra di Contesto (Token gestiti contemporaneamente)
-   **~6x** — Throughput (Rispetto a LLM open di pari categoria)
-   **20T** — Token di Training (Dataset di pre-addestramento)

## Che cos'è Nemotron 3 Ultra

Nemotron 3 Ultra è un modello **Mixture-of-Experts (MoE)** da 550 miliardi di parametri totali, di cui solo 55 miliardi sono attivi per ogni singolo token. Il design MoE — una tecnica che attiva solo una frazione del "cervello" del modello per rispondere a un input — permette di migliorare l'accuratezza senza far esplodere i costi computazionali durante l'inferenza.

A differenza dei tradizionali Transformer, Nemotron 3 Ultra adotta un'architettura ibrida **Mamba-Attention**. Gli strati **Mamba** (una struttura di tipo _State Space Model_) gestiscono le lunghe sequenze con una scalabilità sub-quadratica, riducendo drasticamente il carico di memoria. Al contempo, vengono mantenuti alcuni strati di **Attention** per garantire un richiamo preciso delle informazioni (_recall_) anche su contesti massivi.

![Architettura e prestazioni di NVIDIA Nemotron 3 Ultra](/blogai/backend/uploads/6a2205d55f0d5.webp)

Schema tecnico dell'architettura ibrida di Nemotron 3 Ultra presentata da NVIDIA il 04 giugno 2026.

Il modello è stato pre-addestrato su 20 trilioni (20.000 miliardi) di token di testo, con una finestra di contesto successivamente estesa fino a 1 milione di token. NVIDIA riporta un throughput (velocità di elaborazione dei dati) fino a circa 6 volte superiore rispetto a modelli open-source comparabili, mantenendo un'accuratezza equivalente.

## Innovazioni dell'architettura ibrida

Il modello presenta 108 strati con una dimensione interna di 8.192. Utilizza 64 testine di _query_ e solo 2 testine _key-value_, una configurazione che mantiene estremamente ridotta la cache KV (la memoria temporanea usata per ricordare i token precedenti). Ogni strato MoE ospita 512 "esperti", con i migliori 22 attivati per ogni token.

Tre scelte progettuali definiscono l'efficienza di questo modello:

-   **LatentMoE:** Un sistema di instradamento degli esperti più efficiente. Sacrificando parte della larghezza della dimensione nascosta, permette di consultare più esperti a parità di costo computazionale, migliorando l'accuratezza per singolo parametro.
-   **Multi-Token Prediction (MTP):** Questa tecnica prevede diversi token futuri in un unico passaggio in avanti (_forward pass_). Abilita nativamente il _decoding_ speculativo, accelerando la generazione del testo.
-   **Pre-training in NVFP4:** Utilizza il tipo di dato a 4 bit (E2M1) con quantizzazione a blocchi bidimensionale. Si tratta della più vasta dimostrazione su scala industriale di un addestramento stabile e accurato in formato FP4 (virgola mobile a 4 bit).

L'architettura ibrida Mamba-Attention è cruciale per gli agenti IA: il costo di decodifica di Mamba rimane costante al crescere della sequenza, rendendo il modello ideale per compiti lunghi e iterativi.

## Addestramento e rilascio dei dati

L'addestramento è stato suddiviso in due fasi principali. I primi 15 trilioni di token sono stati selezionati per massimizzare la diversità dei contenuti, mentre gli ultimi 5 trilioni si sono concentrati su dati di altissima qualità. NVIDIA ha inoltre rilasciato nuovi dataset specifici per dominio, inclusi 173 miliardi di token di codice GitHub aggiornati al 30 settembre 2025.

Il processo di post-addestramento ha aggiunto 10 milioni di campioni per il **Supervised Fine-Tuning (SFT)** e 1 milione di nuovi compiti per il **Reinforcement Learning (RL)**. In totale, l'ecosistema Nemotron offre ora 50 milioni di campioni SFT e 55 ambienti di apprendimento per rinforzo.

Durante lo sviluppo sono state documentate due divergenze nella perdita (_loss divergences_). La prima, intorno agli 8 trilioni di token, è stata risolta riportando la riduzione del gradiente dello strato di output da BF16 a FP32. La seconda, a 16 trilioni di token, è stata mitigata anticipando il processo di _annealing_ (riduzione graduale) del tasso di apprendimento.

## Pipeline di Post-Training: MOPD e RLVR

NVIDIA ha introdotto il metodo **Multi-teacher On-Policy Distillation (MOPD)** per raffinare le capacità del modello. Poiché l'addestramento in ambienti misti tende a diluire i segnali di apprendimento, NVIDIA ha addestrato oltre dieci modelli "insegnanti" specializzati in singoli domini (codice, matematica, sicurezza, ecc.).

```mermaid
flowchart TD
    SFT[Fine-Tuning Supervisionato] --> RLVR[RL con Ricompensa Verificabile]
    RLVR --> MOPDW[MOPD Warmup]
    MOPDW --> MOPD[Multi-teacher Distillation]
    MOPD --> MTP[Boosting MTP]
```

Il modello "studente" genera le proprie soluzioni (_rollouts_), che vengono valutate dall'insegnante competente con una guida densa a livello di singolo token. Questo segnale è molto più ricco rispetto alle ricompense sparse del metodo **RLVR (Reinforcement Learning with Verifiable Reward)**.

## Prestazioni e Benchmarking

Nemotron 3 Ultra si confronta direttamente con giganti come GLM-5.1 (754B) e Kimi-K2.6 (1T). Nei compiti legati agli agenti, ha ottenuto 90,0 su **PinchBench** e 56,0 su **ProfBench**. Nel campo dell'ingegneria del software, il punteggio su **SWE-Bench Verified** è di 71,9.

> _\[Grafico interattivo — visibile nella versione web dell'articolo\]_

Un dato rilevante riguarda la resistenza alle allucinazioni: su **AA-Omniscience**, il modello ha registrato il punteggio più alto nel set di confronto (78,7), dimostrando una minore tendenza a fornire risposte incerte o inventate. Per quanto riguarda il contesto lungo, mantiene un punteggio di 94,7 su **RULER** con 1 milione di token.

### Pro

-   Throughput fino a 5,9x superiore su sequenze lunghe
-   Gestione nativa di 1 milione di token di contesto
-   Licenza open per pesi, dati e ricette di addestramento
-   Alta precisione nei compiti di ragionamento per agenti

### Contro

-   Costi di pre-elaborazione (prefill) più alti rispetto a modelli con meno parametri attivi
-   Necessita di hardware Blackwell per sfruttare appieno il formato FP4

## Quantizzazione e Distribuzione

Il modello viene distribuito come un singolo checkpoint **NVFP4**. Sull'architettura NVIDIA Blackwell, opera con matematica FP4 nativa. Sull'architettura Hopper, viene eseguito in modalità **W4A16** (pesi a 4 bit e attivazioni a 16 bit), poiché Hopper non dispone di Tensor Core FP4 nativi.

La soluzione finale opera a 5,03 bit per elemento, mescolando esperti in formato NVFP4 con strati in FP8 per gli esperti condivisi e strati Attention in BF16. Questa configurazione permette di far risiedere i pesi MTP su un singolo nodo H100 con 8 GPU, ottimizzando lo spazio di memoria rispetto a un formato FP8 completo.

## Punti chiave

-   Nemotron 3 Ultra è un modello MoE ibrido Mamba-Attention da 550B totali e 55B attivi.
-   Offre un throughput quasi 6 volte superiore ai concorrenti su carichi di lavoro decode-heavy.
-   Supporta una finestra di contesto fino a 1 milione di token con eccellenti capacità di richiamo.
-   Utilizza la distillazione da multipli insegnanti specializzati (MOPD) per ottimizzare le prestazioni in domini specifici.
-   Il rilascio avviene sotto licenza OpenMDW-1.1, includendo pesi, dati e ricette di training.

### Il nuovo standard per gli agenti open — 4.8/5

NVIDIA Nemotron 3 Ultra non è solo un modello di grandi dimensioni, ma un esercizio di efficienza architettonica. La scelta dell'ibrido Mamba-Attention e la quantizzazione NVFP4 lo rendono lo strumento più avanzato oggi disponibile per chi sviluppa agenti IA complessi che devono operare su contesti lunghi senza costi di inferenza proibitivi.

## FAQ

### Cosa significa architettura ibrida Mamba-Attention?

È una combinazione di strati Mamba, che gestiscono le lunghe sequenze con efficienza lineare, e strati di Attention, che garantiscono la precisione nel recupero delle informazioni. Questo mix riduce il consumo di memoria KV cache.

### Il modello è realmente open source?

È rilasciato sotto licenza OpenMDW-1.1, che permette l'uso dei pesi, dei dataset di addestramento e delle metodologie (ricette) utilizzate da NVIDIA.

### Su quale hardware può essere eseguito?

È ottimizzato per NVIDIA Blackwell (FP4 nativo) e Hopper (W4A16). Può essere eseguito anche su architetture Ampere, sebbene con prestazioni inferiori rispetto alle generazioni più recenti.

### Cos'è il metodo MOPD?

Il Multi-teacher On-Policy Distillation è una tecnica dove diversi modelli esperti (insegnanti) guidano l'apprendimento di un singolo modello studente, fornendo feedback dettagliati su ogni parola generata durante l'addestramento.

## Fonti e riferimenti

1.  [NVIDIA Nemotron 3 Ultra Technical Report](https://research.nvidia.com/labs/nemotron/files/NVIDIA-Nemotron-3-Ultra-Technical-Report.pdf)
2.  [Hugging Face - NVIDIA Nemotron 3 Ultra 550B](https://huggingface.co/nvidia/NVIDIA-Nemotron-3-Ultra-550B-A55B-BF16)
3.  [NVIDIA Developer Blog - Nemotron 3 Ultra Technical Details](https://developer.nvidia.com/blog/nvidia-nemotron-3-ultra-powers-faster-more-efficient-reasoning-for-long-running-agents/)

---

*Fonte: [https://ainsights.it/blog/nvidia-nemotron-3-ultra-rivoluzione-ia](https://ainsights.it/blog/nvidia-nemotron-3-ultra-rivoluzione-ia)*
