Google DeepMind ha rilasciato Gemma 4 12B, un modello multimodale denso che rivoluziona l'architettura classica eliminando completamente gli encoder tradizionali. Grazie a un design in cui visione e audio fluiscono direttamente nel cuore del modello linguistico, questo sistema da 12 miliardi di parametri è in grado di eseguire flussi di lavoro complessi (agentic workflows) su un comune laptop con soli 16 GB di RAM, sotto licenza open Apache 2.0.

16 GB
RAM richiesta
Funzionamento su hardware consumer
12B
Parametri
Modello decoder-only denso
60%+
Incremento qualità
Rispetto alle versioni precedenti in Eloquent
35M
Vision Embedder
Parametri dedicati alla visione (vs 550M standard)

Panoramica del modello e disponibilità

Gemma 4 12B è un trasformatore (transformer) di tipo decoder-only, ovvero un'architettura che genera output sequenzialmente basandosi solo sui dati precedenti. La sua particolarità risiede nella gestione nativa di testo, immagini, audio e video. A differenza dei modelli precedenti, non utilizza componenti separati per interpretare i suoni o le immagini, ma integra tutto in un'unica struttura.

Il modello si posiziona strategicamente tra la versione E4B, ottimizzata per l'uso "edge" (dispositivi locali a bassa potenza), e la variante più grande da 26B basata su Mixture of Experts (MoE), una tecnica che attiva solo una parte dei neuroni per ogni compito per risparmiare calcoli. Gemma 4 12B offre le seguenti specifiche:

  • Architettura: Trasformatore unificato senza encoder.
  • Modalità: Testo, immagini, video e audio nativo (il primo della famiglia Gemma di medie dimensioni a supportare l'audio).
  • Hardware: Richiede 16 GB di VRAM (memoria video) o memoria unificata (come su Apple Silicon).
  • Licenza: Apache 2.0, con pesi scaricabili pubblicamente.
  • Inference: Compatibile con i principali strumenti del settore come llama.cpp, MLX, vLLM, Ollama, SGLang, Unsloth e LM Studio.

I pesi del modello sono disponibili su Hugging Face e Kaggle, con la variante ottimizzata per le istruzioni denominata google/gemma-4-12B-it. È stato inoltre rilasciato un modello "drafter" dedicato alla Multi-Token Prediction (MTP), una tecnica che permette di prevedere più parole contemporaneamente per ridurre i tempi di risposta (latenza) su hardware locale.

Infografica delle caratteristiche di Gemma 4 12B
Schema delle capacità multimodali e dell'efficienza di Gemma 4 12B su dispositivi locali.

Architettura: il design senza encoder

Nelle versioni precedenti di Gemma, il modello si affidava a encoder separati per la visione e l'audio. Questi componenti aggiungevano latenza e occupavano memoria preziosa: i modelli medi includevano solitamente un encoder visivo da 550 milioni di parametri e uno audio da 300 milioni. In Gemma 4 12B, questi sono stati eliminati a favore di un sistema più snello.

Vision Embedder da 35M

Il sistema di visione è stato ridotto a un componente di soli 35 milioni di parametri. Le immagini grezze vengono suddivise in piccoli quadrati chiamati patch da 48×48 pixel. Ogni patch viene proiettata nello spazio del modello linguistico tramite una singola moltiplicazione di matrice, senza livelli di attenzione dedicati. La posizione spaziale viene gestita tramite una ricerca di coordinate "fattorizzata" (X e Y separate), che vengono poi normalizzate e aggiunte all'embedding della patch. Questo rende l'intera pipeline visiva estremamente veloce.

Proiezione diretta dell'onda audio

L'audio a 16 kHz viene segmentato in frame da 40 millisecondi (640 valori ciascuno). Questi dati vengono proiettati linearmente nello stesso spazio dei token testuali. Non c'è estrazione di caratteristiche complessa né strati Conformer (architetture specializzate nel processare audio e parlato). La sequenza temporale è gestita dai Rotary Position Embeddings (RoPE) già presenti nel modello linguistico. Questo approccio elimina i 12 strati conformer utilizzati nelle versioni precedenti.

Capacità e Prestazioni

Sebbene Google DeepMind non abbia ancora pubblicato tabelle comparative complete, i dati iniziali indicano che Gemma 4 12B raggiunge prestazioni vicine al modello 26B MoE, pur occupando meno della metà della memoria. Le capacità dimostrate includono:

  • Riconoscimento vocale automatico (ASR): Trascrizione nativa senza bisogno di sistemi esterni.
  • Diarizzazione: Capacità di distinguere diversi interlocutori all'interno di una traccia audio.
  • Comprensione video: Elaborazione di fotogrammi video insieme all'audio. In un test, il modello ha analizzato 5 minuti di un keynote Google I/O elaborando 313 fotogrammi (1 al secondo).
  • Generazione di codice: Il modello è in grado di creare applicazioni (come una app Gradio per il processamento immagini) servito localmente tramite llama.cpp.

Nell'applicazione Google AI Edge Eloquent, il passaggio a Gemma 4 12B ha portato a un miglioramento superiore al 60% nella qualità complessiva, con una maggiore precisione nel seguire le istruzioni degli utenti.

Confronto Parametri Encoder
Mostra dati
Confronto Parametri Encoder
VoceMilioni di parametri
Encoder Visione Precedente550
Vision Embedder Gemma 4 12B35
Encoder Audio Precedente300
Audio Embedder Gemma 4 12B0
Fonte: Google DeepMind

Esecuzione locale e integrazione

Gli sviluppatori possono integrare il modello attraverso diverse strade già disponibili al lancio:

  1. Google AI Edge Gallery: Per l'esecuzione in ambienti Python protetti (sandbox) su macOS.
  2. LiteRT-LM CLI: Il comando litert-lm serve permette di esporre un endpoint compatibile con le API di OpenAI, facilitando l'uso con strumenti come Aider o Open WebUI.
  3. Ecosistema Open: Supporto immediato per Unsloth, Transformers e vLLM per il deployment su Cloud Run o Google Kubernetes Engine (GKE).
Il nostro verdetto
4.8/ 5

Una rivoluzione per l'AI locale

Gemma 4 12B stabilisce un nuovo standard per i modelli multimodali di medie dimensioni. L'approccio encoder-free non solo riduce i requisiti hardware, ma semplifica drasticamente il fine-tuning e l'integrazione in applicazioni locali senza sacrificare la qualità.

Cosa significa che il modello è encoder-free?
Significa che non ha componenti separati per elaborare immagini o suoni prima di inviarli al modello linguistico. I dati visivi e sonori vengono convertiti direttamente in un formato comprensibile dall'LLM, riducendo memoria e latenza.
Posso usarlo sul mio PC con 16 GB di RAM?
Sì, il modello è progettato specificamente per girare su hardware consumer con 16 GB di memoria unificata o VRAM.
Quali lingue supporta?
Supporta il testo multilingue e l'audio nativo a 16 kHz per trascrizione e analisi.
Dove posso scaricare i pesi?
I pesi sono disponibili su Hugging Face nel repository google/gemma-4-12B-it.

Fonti e riferimenti

  1. Google DeepMind - Introducing Gemma 4 12B
  2. Hugging Face - Gemma 4 Collection
  3. Gemma Skills GitHub Repository