---
title: "LiteRT-LM: il runtime di Google per accelerare Gemma 4 sui dispositivi"
date: "2026-06-05"
category: "Intelligenza Artificiale"
tags: ["gemma 4", "google-ai", "intelligenza artificiale", "litert-lm", "on-device-ai"]
author: "Giuseppe Carruezzo"
description: "Scopri come LiteRT-LM ottimizza l'inferenza di Gemma 4 su mobile e desktop, migliorando la velocità fino a 2,2 volte grazie alla tecnologia MTP."
source: "https://ainsights.it/blog/litert-lm-accelerazione-gemma-4-dispositivi"
---

# LiteRT-LM: il runtime di Google per accelerare Gemma 4 sui dispositivi

![LiteRT-LM: il runtime di Google per accelerare Gemma 4 sui dispositivi](/blogai/backend/uploads/6a235ae94616a.webp)

Google ha annunciato il supporto nativo di LiteRT-LM per i "drafter" Multi-Token Prediction (MTP) di Gemma 4. Questa integrazione consente di accelerare l'inferenza locale sui dispositivi mobili e desktop fino a 2,2 volte. Il framework espande inoltre la propria compatibilità introducendo nuove API per Swift e JavaScript, affiancando i già presenti linguaggi Kotlin e C++.

-   **2,2x** — Velocità massima (Incremento delle prestazioni di inferenza locale con Gemma 4 MTP)
-   **607 MB** — Uso memoria su iOS (Spazio occupato in RAM dal modello Gemma 4 E2B da 2,58 GB)
-   **da 1,8x a 3,7x** — Vantaggio competitivo (Velocità di prefill e decode rispetto a llama.cpp e ONNX)

## Cos'è LiteRT-LM e come ottimizza i modelli on-device

LiteRT-LM è uno strato di orchestrazione specializzato, sviluppato sopra LiteRT (precedentemente noto come TensorFlow Lite). È progettato specificamente per gestire i modelli linguistici di grandi dimensioni (LLM, _Large Language Models_) direttamente sui dispositivi degli utenti finali (on-device), garantendo elevate prestazioni su piattaforme Android, iOS e web. L'inferenza è l'esecuzione attiva di un modello di intelligenza artificiale per generare risposte basate su nuovi dati di input.

La base tecnologica di LiteRT-LM consente di gestire i limiti hardware tipici dei dispositivi mobili, come la memoria RAM ridotta, la potenza di calcolo limitata e la frammentazione dei chip. Per farlo, sfrutta schemi avanzati di quantizzazione (la riduzione della precisione numerica dei parametri del modello per risparmiare risorse) e kernel accelerati come XNNPACK e MLDrift, librerie software ottimizzate per l'esecuzione rapida di operazioni matematiche su CPU e GPU.

A livello di orchestrazione, il framework impiega pipeline ottimizzate per ridurre al minimo i costosi trasferimenti di dati tra CPU e GPU, supporta la predizione multi-token e include una gestione avanzata delle sessioni. Questa combinazione lo rende, secondo Google, l'ambiente di runtime più performante per l'esecuzione locale dei modelli Gemma.

## Come funziona la decodifica speculativa con MTP

Il Multi-Token Prediction (MTP) è una tecnica introdotta con la famiglia di modelli Gemma 4 che consente la generazione simultanea di più token (le unità di testo elaborate dai modelli), riducendo i passaggi sequenziali tradizionali. LiteRT-LM implementa questa tecnica attraverso la decodifica speculativa, ottimizzando lo scambio di dati tra il modello principale Gemma 4 e il modello secondario più leggero (denominato "drafter" o redattore).

Per superare i colli di bottiglia tipici di questo approccio, LiteRT-LM impone la "località della memoria": esegue sia il leggero modello drafter che il modello primario sullo stesso componente hardware, tipicamente la GPU. La gestione della KV cache (la memoria temporanea che contiene i calcoli dei token passati) e delle attivazioni all'interno della memoria locale elimina i ritardi di sincronizzazione tra diversi processori.

Una volta che il drafter ha predetto i token futuri, il modello principale li valuta utilizzando kernel ottimizzati che massimizzano la parallelizzazione durante la fase di verifica.

```mermaid
flowchart TD
  A[Prompt Utente] --> B[Drafter leggero genera ipotesi di token]
  B --> C[Esecuzione sulla stessa GPU locale]
  C --> D[Modello Gemma 4 primario verifica i token in parallelo]
  D --> E{Accettati?}
  E -- Sì --> F[Generazione completata velocemente]
  E -- No --> G[Correzione dei token e ripetizione]
```

**Nota tecnica:** Evitare lo scambio continuo di dati tra la memoria VRAM e le unità di calcolo è fondamentale nei dispositivi mobile per non congestionare la larghezza di banda del sistema e preservare l'autonomia della batteria.

## Prestazioni ed efficienza della memoria nei benchmark

Secondo i test prestazionali effettuati da Google, la decodifica MTP su LiteRT-LM risulta 1,6 volte più veloce per il modello Gemma 4 E2B e fino a 2,2 volte più veloce per il modello Gemma 4 E4B. Inoltre, sia la fase di prefill (l'elaborazione iniziale del prompt di input) che quella di decode (la generazione effettiva della risposta) registrano velocità da 1,8 a 3,7 volte superiori rispetto a framework concorrenti come llama.cpp, MLX, Cactus e ONNX.

<table style="min-width: 75px;"><colgroup><col style="min-width: 25px;"><col style="min-width: 25px;"><col style="min-width: 25px;"></colgroup><tbody><tr><th colspan="1" rowspan="1"><p>Metrica / Scenario</p></th><th colspan="1" rowspan="1"><p>LiteRT-LM (Gemma 4 MTP)</p></th><th colspan="1" rowspan="1"><p>Framework Concorrenti (llama.cpp, MLX, ONNX)</p></th></tr><tr><td colspan="1" rowspan="1"><p>Fattore di accelerazione generale</p></td><td colspan="1" rowspan="1"><p>Fino a 2,2x più veloce</p></td><td colspan="1" rowspan="1"><p>1,0x (Riferimento)</p></td></tr><tr><td colspan="1" rowspan="1"><p>Fase di Prefill e Decode</p></td><td colspan="1" rowspan="1"><p>Da 1,8x a 3,7x più rapido</p></td><td colspan="1" rowspan="1"><p>Standard del settore</p></td></tr><tr><td colspan="1" rowspan="1"><p>Impronta RAM (Modello Gemma 4 E2B da 2,58 GB)</p></td><td colspan="1" rowspan="1"><p>~607 MB su CPU Apple Silicon</p></td><td colspan="1" rowspan="1"><p>Significativamente superiore</p></td></tr></tbody></table>

L'efficienza della memoria è un pilastro centrale di LiteRT-LM. Il runtime riduce al minimo l'impronta complessiva mantenendo gli embedding (le rappresentazioni vettoriali delle parole) di ciascun livello fuori dalla memoria attiva, caricando dinamicamente gli encoder audio e video solo quando richiesto dal contesto. Di conseguenza, il modello Gemma 4 E2B da circa 2,58 GB richiede solo 607 MB di RAM quando viene eseguito sulle CPU mobile di Apple.

## Funzionalità avanzate per agenti IA e nuove API

Il sistema integra nativamente il supporto per comportamenti agentici avanzati:

-   **Thinking Mode di Gemma 4:** supporta l'esecuzione di passaggi logici intermedi prima di restituire l'output finale all'utente.
    
-   **Decodifica vincolata (Constrained Decoding):** garantisce la generazione strutturata di dati in formati specifici (come JSON), riducendo gli errori di interpretazione software.
    
-   **Chiamata di funzioni (Function-calling):** consente al runtime di sospendere temporaneamente l'esecuzione del modello per restituire una richiesta strutturata a uno strumento esterno, riprendendo l'elaborazione una volta ricevuto il risultato.
    

Inoltre, la gestione della sessione in LiteRT-LM è una funzionalità integrata di prima classe. È in grado di salvare e ripristinare lo stato della KV cache, consentendo la prosecuzione di interazioni lunghe ed evitando di dover ricalcolare i dati delle conversazioni passate ad ogni nuovo inserimento.

LiteRT-LM è disponibile su GitHub ed è corredato da un'interfaccia a riga di comando (CLI) per la sperimentazione in ambiente desktop, oltre a un'applicazione mobile di esempio all'interno della galleria di progetti Google AI Edge.

## Punti chiave

-   LiteRT-LM accelera l inferenza di Gemma 4 on-device fino a 2,2x sfruttando il Multi-Token Prediction (MTP).
-   La decodifica speculativa viene ottimizzata tramite la località della memoria sulla GPU per evitare latenze di trasferimento dati.
-   L impronta di memoria RAM per il modello Gemma 4 E2B si attesta a soli 607 MB su architetture Apple Silicon.
-   Supporta nativamente funzionalità per agenti come il function-calling, la Thinking Mode e la generazione strutturata di dati.
-   Il framework estende la propria portata introducendo API dedicate per Swift e JavaScript oltre a Kotlin e C++.

## Disponibilità e risorse di sviluppo

Il progetto è attivamente sviluppato da Google all'interno dell'ecosistema AI Edge. Gli sviluppatori possono testare le capacità di LiteRT-LM localmente tramite i repository ufficiali e l'applicazione di prova, integrando funzionalità avanzate di generazione di testo direttamente all'interno di applicazioni native per smartphone e web app moderne.

## FAQ

### Come fa LiteRT-LM a raggiungere una velocità superiore rispetto ad altri framework?

Utilizza la decodifica speculativa coordinando il modello di bozza (drafter) e il modello principale sulla stessa GPU, minimizzando i colli di bottiglia nel trasferimento dei dati e parallelizzando la verifica dei token.

### Quali linguaggi sono ora supportati da LiteRT-LM?

Oltre ai linguaggi di lancio Kotlin e C++, sono state introdotte nuove API per lo sviluppo nativo in Swift (per iOS) e JavaScript (per il Web).

### Cos è la decodifica vincolata (constrained decoding)?

È una tecnica che obbliga il modello linguistico a produrre risposte in un formato rigoroso (ad esempio JSON o schemi predefiniti), facilitando l integrazione immediata dell output con il codice applicativo.

## Fonti e riferimenti

1.  [Blazing fast on-device GenAI with LiteRT-LM](https://developers.googleblog.com/blazing-fast-on-device-genai-with-litert-lm/)
2.  [Gemma 4 Multi-Token Prediction - InfoQ News](https://www.infoq.com/news/2026/05/gemma4-multi-token-prediction/)
3.  [LiteRT-LM Constrained Decoding Documentation](https://ai.google.dev/edge/litert-lm/cpp#constrained_decoding)
4.  [On-Device Function Calling in Google AI Edge Gallery](https://developers.googleblog.com/on-device-function-calling-in-google-ai-edge-gallery/)
5.  [LiteRT-LM GitHub Repository](https://github.com/google-ai-edge/LiteRT-LM)

---

*Fonte: [https://ainsights.it/blog/litert-lm-accelerazione-gemma-4-dispositivi](https://ainsights.it/blog/litert-lm-accelerazione-gemma-4-dispositivi)*
