---
title: "NVIDIA Nemotron 3 Ultra: L'AI per Agenti Multi-Agenti Evoluti"
date: "2026-06-05"
category: "Intelligenza Artificiale"
tags: ["agenti ai", "deep learning", "intelligenza artificiale", "nemotron", "nvidia"]
author: "Giuseppe Carruezzo"
description: "Scopri NVIDIA Nemotron 3 Ultra, il modello MoE da 550B parametri progettato per l'orchestrazione di agenti AI con efficienza e prestazioni superiori."
source: "https://ainsights.it/blog/nvidia-nemotron-3-ultra-ai-agenti-multi-agenti"
---

# NVIDIA Nemotron 3 Ultra: L'AI per Agenti Multi-Agenti Evoluti

![NVIDIA Nemotron 3 Ultra: L'AI per Agenti Multi-Agenti Evoluti](/blogai/backend/uploads/6a2217b66edcf.webp)

I chatbot tradizionali stanno evolvendo in agenti a lunga durata capaci di ragionare, mantenere il contesto e utilizzare strumenti complessi per completare workflow articolati. NVIDIA Nemotron 3 Ultra si inserisce in questo scenario come un modello Mixture-of-Experts (MoE) da 550 miliardi di parametri, progettato specificamente per orchestrare sistemi multi-agente con un'efficienza senza precedenti.

-   **550B** — Parametri totali (Modello Mixture-of-Experts con 55B parametri attivi per token)
-   **5x** — Throughput (Velocità di elaborazione superiore rispetto ai modelli open della stessa categoria)
-   **30%** — Risparmio costi (Riduzione dei costi per il completamento di task complessi)
-   **1M** — Contesto (Supporto per finestre di contesto fino a 1 milione di token)

![Illustrazione di NVIDIA Nemotron 3 Ultra che mostra l'architettura del modello.](/blogai/backend/uploads/6a2217b69b8b9.webp)

NVIDIA Nemotron 3 Ultra è ottimizzato per il ragionamento avanzato e l'efficienza operativa in sistemi basati su agenti.

## Orchestrazione di agenti: oltre la singola interazione

In un workflow basato su agenti, il numero di token — le unità base di testo elaborate dall'AI — cresce rapidamente. Gli agenti devono pianificare, richiamare strumenti, invocare sub-agenti e analizzare costantemente la cronologia delle azioni. Questo processo iterativo aumenta i costi e il rischio di "drift" (deriva), dove l'AI perde di vista l'obiettivo finale.

Nemotron 3 Ultra affronta queste sfide gestendo le "chiamate difficili": decisioni architettoniche in sessioni di programmazione, sintesi di fonti di ricerca contraddittorie o verifica di design di chip con migliaia di vincoli. Il modello utilizza un'architettura Mixture-of-Experts (MoE), una tecnica che attiva solo una frazione dei parametri (55 miliardi su 550) per ogni richiesta, garantendo alta precisione con un consumo computazionale ottimizzato.

| Benchmark (Area) | Nemotron 3 Ultra (550B) | GLM 5.1 (744B) | Kimi K2.6 (1T) | Qwen3.5 (397B) |
| --- | --- | --- | --- | --- |
| Productivity (PinchBench) | **91%** | 84% | **91%** | 89% |
| Planning (EnterpriseOps) | 33% | **40%** | 29% | 30% |
| Coding (Terminal-Bench 2.0) | 54% | 64% | **67%** | 53% |
| Instruction Following (IFBench) | **82%** | 77% | 74% | 78% |
| Long Context (Ruler @1M) | **95%** | N/A | N/A | 90% |

Il benchmark **Ruler @1M** misura la capacità del modello di recuperare informazioni specifiche all'interno di una finestra di contesto di un milione di token, un requisito fondamentale per agenti che analizzano intere documentazioni tecniche.

## Innovazioni architettoniche per il throughput elevato

Per superare i limiti dei modelli tradizionali, NVIDIA ha introdotto diverse innovazioni tecniche che permettono a Nemotron 3 Ultra di raggiungere un throughput (velocità di generazione) fino a 5 volte superiore rispetto alla concorrenza:

-   **Hybrid Mamba-Transformer:** combina i layer Mamba, efficienti nella gestione di lunghe sequenze, con i layer Transformer, necessari per mantenere una memoria precisa dei fatti nel contesto.
-   **Precisione NVFP4:** un formato di quantizzazione (riduzione della precisione numerica per risparmiare memoria) che permette al modello di girare su architetture NVIDIA Hopper, Blackwell e Ampere con un unico checkpoint, garantendo prestazioni elevate senza perdita di accuratezza.
-   **Multi-token prediction (MTP):** permette al modello di prevedere più token futuri in un singolo passaggio, riducendo drasticamente i tempi di generazione per output lunghi.
-   **LatentMoE:** ottimizza il routing (lo smistamento) delle richieste verso gli "esperti" più qualificati all'interno del modello, migliorando la gestione di logiche specifiche come il codice o i richiami a strumenti esterni.

> _\[Grafico interattivo — visibile nella versione web dell'articolo\]_

## Multi-Teacher On-Policy Distillation (MOPD)

Il processo di addestramento di Nemotron 3 Ultra si basa sulla **MOPD**, una tecnica di distillazione dove il modello "studente" impara simultaneamente da oltre 10 modelli "insegnanti" specializzati in domini diversi (legale, codice, ragionamento logico).

```mermaid
flowchart TD
    A[Modello Studente Nemotron] --> B{Generazione Tentativi}
    B --> C[Insegnante Coding]
    B --> D[Insegnante Legal]
    B --> E[Insegnante Reasoning]
    C --> F[Segnale di Ricompensa denso]
    D --> F
    E --> F
    F --> G[Ottimizzazione Studente]
    G --> A
```

Durante questo addestramento iterativo, gli insegnanti valutano i tentativi dello studente in tempo reale. Questo co-sviluppo permette una specializzazione progressiva e prestazioni superiori su benchmark come **SWE-bench Verified**, dove il modello raggiunge punteggi tra il 65% e il 70,4%.

## Dati di addestramento e specializzazione settoriale

Oltre alle capacità di ragionamento, NVIDIA ha arricchito il dataset di pre-training (già basato su 10 trilioni di token) con 212 miliardi di token aggiuntivi focalizzati su aree ad alto valore:

1.  **4 miliardi di token legali sintetici:** hanno innalzato le prestazioni su LegalBench dal 64,6% al 74,7%.
2.  **35 miliardi di token basati su Wikipedia:** per migliorare la conoscenza enciclopedica e ridurre le allucinazioni.
3.  **173 miliardi di token GitHub aggiornati:** con dati fino al 30 settembre 2025, per garantire la massima competenza nelle librerie software più recenti.

## Sicurezza e interazione vocale: i modelli complementari

Insieme a Ultra, NVIDIA ha rilasciato due modelli specializzati per compiti verticali:

-   **Nemotron 3.5 Content Safety:** un modello da 4 miliardi di parametri che funge da guardrail (protezione) per identificare contenuti non sicuri o violazioni di policy in 12 lingue e 23 categorie di rischio.
-   **Nemotron 3.5 ASR:** un modello di riconoscimento vocale multilingue (40+ lingue) progettato per la bassa latenza (sotto i 100 ms), ideale per agenti vocali che devono rispondere in tempo reale.

## Punti chiave

-   Nemotron 3 Ultra è un modello MoE da 550B parametri ottimizzato per workflow multi-agente lunghi e complessi.
-   Offre un throughput 5x superiore e una riduzione dei costi operativi del 30% rispetto ai concorrenti open.
-   L’architettura ibrida Mamba-Transformer garantisce efficienza su contesti fino a 1M di token senza perdere precisione.
-   Il modello è rilasciato con licenza OpenMDW-1.1, facilitando l’adozione commerciale e la modifica.
-   Integra tecnologie avanzate come la distillazione multi-teacher (MOPD) e la quantizzazione NVFP4.

### Il nuovo standard per l’AI Agentica — 4.8/5

NVIDIA Nemotron 3 Ultra non è solo un modello più grande, ma un sistema pensato per la produzione. La combinazione di velocità estrema, precisione sui lunghi contesti e un ecosistema di strumenti di sicurezza lo rende la scelta primaria per chi sviluppa agenti autonomi complessi.

## FAQ

### Cosa significa Mixture-of-Experts (MoE)?

È una tecnica in cui il modello è composto da diversi sottogruppi specializzati (esperti). Per ogni richiesta, il sistema attiva solo una parte di essi, riducendo il carico computazionale senza sacrificare la conoscenza totale del modello.

### Nemotron 3 Ultra è utilizzabile commercialmente?

Sì, viene rilasciato sotto licenza OpenMDW-1.1 della Linux Foundation, che permette l’uso, la modifica e la redistribuzione con termini chiari per le imprese.

### Quali sono i requisiti hardware per il deployment?

Grazie alla quantizzazione NVFP4, il modello può essere eseguito in modo efficiente su GPU NVIDIA Hopper (H100/H200) e Blackwell (B100/B200), ma supporta anche l’architettura Ampere.

### In cosa differisce dalla versione ASR?

La versione Ultra è il cervello del sistema (ragionamento e testo), mentre la versione ASR (Automatic Speech Recognition) è specializzata nel convertire il parlato in testo con bassissima latenza.

## Fonti e riferimenti

1.  [NVIDIA Technical Blog: Nemotron 3 Ultra](https://developer.nvidia.com/blog/nvidia-nemotron-3-ultra-powers-faster-more-efficient-reasoning-for-long-running-agents/)
2.  [Nemotron 3 Ultra Technical Report](https://research.nvidia.com/labs/nemotron/files/NVIDIA-Nemotron-3-Ultra-Technical-Report.pdf)
3.  [Hugging Face - NVIDIA Nemotron Collection](https://huggingface.co/collections/nvidia/nvidia-nemotron-v3)

---

*Fonte: [https://ainsights.it/blog/nvidia-nemotron-3-ultra-ai-agenti-multi-agenti](https://ainsights.it/blog/nvidia-nemotron-3-ultra-ai-agenti-multi-agenti)*
