---
title: "MiniMax M3: L'IA con 1 milione di token e architettura MSA"
date: "2026-06-01"
category: "Intelligenza Artificiale"
tags: ["intelligenza artificiale", "minimax", "modelli linguistici", "msa", "tecnologia"]
author: "Giuseppe Carruezzo"
description: "Scopri MiniMax M3, il modello AI con 1 milione di token e architettura MSA. Prestazioni record in programmazione, multimodalità e automazione desktop."
source: "https://ainsights.it/blog/minimax-m3-ia-architettura-msa"
---

# MiniMax M3: L'IA con 1 milione di token e architettura MSA

![MiniMax M3: L'IA con 1 milione di token e architettura MSA](/blogai/backend/uploads/6a1e10afb4563.webp)

MiniMax ha ufficialmente presentato MiniMax M3 il 1° giugno 2026, un modello di frontiera che introduce l'architettura MSA (MiniMax Sparse Attention) per gestire una finestra di contesto da 1 milione di token. Il modello integra nativamente capacità multimodali e prestazioni di programmazione avanzate, posizionandosi come il primo sistema open-weight a combinare elaborazione di documenti lunghi, input video/immagine e automazione desktop in un'unica struttura.

-   **1M** — Token di contesto (Capacità di elaborazione della finestra di input)
-   **59,0%** — SWE-Bench Pro (Punteggio nel benchmark di ingegneria del software)
-   **15x** — Velocità decoding (Incremento rispetto alla generazione M2 a 1M token)
-   **70,06%** — OSWorld-Verified (Tasso di completamento compiti nelluso del computer)

![Panoramica di MiniMax M3 e delle sue capacità agentiche e multimodali](/blogai/backend/uploads/6a1dff73dcb4c.webp)

MiniMax M3 introduce una nuova architettura per la gestione di contesti estesi e l'interazione con ambienti desktop.

## MSA: L’architettura MiniMax Sparse Attention

L'innovazione centrale di MiniMax M3 risiede nella **MSA (MiniMax Sparse Attention)**. Nei modelli standard, il meccanismo di attenzione presenta una complessità computazionale quadratica: raddoppiare la lunghezza del testo quadruplica il costo di calcolo. La MSA è progettata per superare questo limite strutturale tramite una fase di pre-filtraggio che evita il calcolo completo della matrice di attenzione.

A differenza di altri approcci come DSA o MoBA, MSA suddivide la **KV cache** (un sistema di memoria che memorizza le chiavi e i valori dei token precedenti per velocizzare la generazione) in blocchi precisi, garantendo una copertura del contesto più efficace. A livello tecnico, utilizza un approccio "KV outer gather Q": i blocchi KV fungono da ciclo esterno per aggregare le query che li colpiscono. Questo metodo permette di leggere ogni blocco una sola volta, ottimizzando l'accesso alla memoria.

Secondo i dati tecnici, a una lunghezza di 1 milione di token, il calcolo per singolo token di M3 è pari a solo 1/20 rispetto ai modelli M2 della generazione precedente.

> _\[Grafico interattivo — visibile nella versione web dell'articolo\]_

## Benchmark di programmazione e capacità agentiche

MiniMax M3 è stato testato intensamente su benchmark relativi alla programmazione e alle capacità agentiche (ovvero la capacità di un'IA di agire autonomamente come un agente software). I risultati posizionano il modello ai vertici del settore, superando in diverse categorie modelli come GPT-5.5 e Gemini 3.1 Pro.

-   **SWE-Bench Pro:** 59,0% (avvicinandosi a Opus 4.7).
-   **Terminal-Bench 2.1:** 66,0% nella gestione di comandi da terminale.
-   **MCP Atlas:** 74,2% nell'integrazione di strumenti esterni.
-   **OSWorld-Verified:** 70,06% di successo nell'interazione con sistemi operativi desktop.

Per colmare il divario tra i test sintetici e l'uso reale, MiniMax ha sviluppato un framework di simulazione utente interattivo. Questo sistema addestra il modello a gestire flussi di lavoro complessi che includono la discussione di soluzioni, la correzione basata sui feedback e il passaggio continuo tra diversi compiti all'interno dello stesso progetto.

## Multimodalità nativa e addestramento integrato

A differenza di molti modelli che aggiungono capacità visive dopo l'addestramento testuale, MiniMax M3 è stato addestrato in modalità mista sin dal "passo zero". Testo, immagini e video sono stati elaborati simultaneamente, ricostruendo l'intera pipeline di dati per gestire formati **interleaved** (sequenze dove testo e immagini sono naturalmente mescolati).

Il set di dati utilizzato per l'addestramento è stato scalato nell'ordine dei 100 trilioni di token. Questa integrazione profonda permette al modello non solo di "vedere" un documento o un video, ma di comprendere il contesto operativo necessario per gestire un computer, leggendo interfacce grafiche e agendo di conseguenza.

### Pro

-   Finestra di contesto enorme (1M token) con costi ridotti
-   Capacità agentiche superiori in compiti di programmazione reali
-   Multimodalità nativa che supporta luso diretto del desktop
-   Pesi del modello aperti (open-weights)

### Contro

-   Richiede hardware specifico per ottimizzazioni spinte (es. NVIDIA Blackwell)
-   Le prestazioni in alcuni task di training autonomo sono leggermente inferiori a Opus 4.7

## Casi d’uso reali: dall’ottimizzazione CUDA alla ricerca scientifica

MiniMax ha documentato tre scenari applicativi interni che dimostrano la potenza operativa di M3:

### Riproduzione di paper scientifici

M3 ha ricevuto il paper vincitore dell'ICLR 2025 "Learning Dynamics of LLM Finetuning" con l'istruzione di riprodurre gli esperimenti. In 12 ore di attività autonoma, il modello ha generato 18 commit di codice e 23 grafici sperimentali, completando i test principali senza intervento umano. Questo compito ha richiesto la capacità di leggere formule (multimodalità), mantenere in memoria l'intero studio (long context) e scrivere codice complesso.

### Ottimizzazione di kernel CUDA

In un test di 24 ore, il modello ha ottimizzato un kernel di moltiplicazione di matrici (GEMM) FP8 su architettura NVIDIA Hopper. Partendo da zero, M3 ha effettuato 1.959 chiamate a strumenti e 147 invii di test. Il risultato è stato un incremento dell'utilizzo del picco hardware dal 7,6% al 71,3%, un miglioramento di oltre 9 volte rispetto alla base di partenza.

## Come MiniMax M3 ottimizza il codice hardware

1.  **Diagnosi colli di bottiglia**: Analisi delle prestazioni iniziali e identificazione dei limiti di memoria.
2.  **Generazione configurazioni**: Creazione di script di autotuning per trovare i parametri ottimali.
3.  **Riscrittura kernel**: Implementazione di tecniche avanzate come CUDA Graphs e kernel persistenti.
4.  **Validazione finale**: Invio iterativo al benchmark fino al raggiungimento del picco di utilizzo hardware.

### PostTrainBench: addestramento autonomo di modelli

M3 è stato testato nella gestione dell'intero ciclo di vita di altri modelli: sintesi dei dati, addestramento, valutazione e iterazione. In 12 ore, ha gestito autonomamente l'evoluzione di quattro modelli base per acquisire capacità matematiche e di ragionamento scientifico, ottenendo un punteggio di 0,37 e superando la maggior parte dei concorrenti nei test di autonomia.

## Punti chiave

-   MiniMax M3 è un modello open-weight con 1 milione di token di contesto, lanciato il 1° giugno 2026.
-   Larchitettura MSA riduce drasticamente i costi computazionali (1/20 rispetto a M2) pur mantenendo alte prestazioni.
-   Il modello eccelle nelluso del computer e nella programmazione avanzata, superando GPT-5.5 in benchmark chiave come SWE-Bench Pro.
-   Laddestramento multimodale nativo permette a M3 di elaborare testo, immagini e video simultaneamente.
-   LAPI è già disponibile, con piani di abbonamento a partire da 20 dollari al mese.

### Un nuovo standard per i modelli open-weight — 4.8/5

MiniMax M3 non è solo un incremento incrementale; lintroduzione della MSA e la capacità di operare autonomamente su compiti di ingegneria complessi lo rendono uno degli strumenti più potenti per sviluppatori e ricercatori. La combinazione di contesto esteso e multimodalità nativa apre la strada ad agenti AI realmente operativi.

## FAQ

### Cosa significa che M3 è un modello open-weight?

Significa che MiniMax rilascia i pesi del modello, permettendo ai ricercatori e agli sviluppatori di eseguirlo localmente o di personalizzarlo, a differenza dei modelli chiusi accessibili solo via API.

### Qual è la differenza tra la modalità standard e la modalità Thinking?

La modalità Thinking può essere attivata tramite API per compiti che richiedono un ragionamento logico più profondo, mantenendo lo stesso costo per token.

### Quanto costa utilizzare MiniMax M3 tramite API?

Esistono vari piani: il piano Plus costa 20 dollari al mese per circa 1,7 miliardi di token, mentre il piano Ultra arriva a 120 dollari per circa 9,8 miliardi di token.

### Come gestisce M3 i contesti molto lunghi?

Grazie allarchitettura MSA (Sparse Attention), il modello può elaborare fino a 1 milione di token con una velocità di prefill 9 volte superiore e una velocità di generazione 15 volte superiore rispetto alla generazione precedente.

## Fonti e riferimenti

1.  [MiniMax Platform - Technical Details](https://platform.minimax.io/docs/guides/models-intro)
2.  [MiniMax Official Twitter Announcement](https://x.com/MiniMax_AI/status/2061266317815296322)
3.  [MiniMax Code Download](https://agent.minimaxi.com/download)

---

*Fonte: [https://ainsights.it/blog/minimax-m3-ia-architettura-msa](https://ainsights.it/blog/minimax-m3-ia-architettura-msa)*
