---
title: "Nuovi modelli Gemini: efficienza e velocità per agenti IA"
date: "2026-07-21"
category: "Sviluppo AI"
tags: ["agenti ai", "gemini", "google deepmind", "intelligenza artificiale", "sviluppo ai"]
author: "Giuseppe Carruezzo"
description: "Google annuncia Gemini 3.6 Flash e 3.5 Flash-Lite: modelli ottimizzati per costi, velocità e automazione avanzata. Scopri i dettagli, benchmark e prezzi."
source: "https://ainsights.it/blog/nuovi-modelli-gemini-efficienza-velocita-agenti-ia"
---

# Nuovi modelli Gemini: efficienza e velocità per agenti IA

![Nuovi modelli Gemini: efficienza e velocità per agenti IA](/blogai/backend/uploads/6a6003e7517d0.webp)

Costruire agenti basati su intelligenza artificiale per ambienti di produzione non richiede solo potenza di calcolo, ma soprattutto efficienza economica, latenza ridotta e risposte sintetiche. In data 21 luglio 2026, Google ha annunciato tre nuove aggiunte alla propria famiglia di modelli compatti: **Gemini 3.6 Flash**, **Gemini 3.5 Flash-Lite** e **Gemini 3.5 Flash Cyber**, segnando un passaggio fondamentale nell'orchestrazione di flussi di lavoro complessi e ad alta frequenza.

-   **\-17%** — Token di output (Riduzione dei token generati da Gemini 3.6 Flash rispetto a 3.5 Flash)
-   **350** — Token/secondo (Velocità di output di Gemini 3.5 Flash-Lite misurata da Artificial Analysis)
-   **54,2%** — SWE-Bench Pro (Punteggio di Gemini 3.5 Flash-Lite, superiore rispetto a Gemini 3 Flash)

Nel panorama dell'intelligenza artificiale generativa, gli _agenti autonomi_ — software capaci di pianificare ed eseguire sequenze di operazioni complesse utilizzando strumenti esterni — stanno sostituendo i tradizionali chatbot monocordo. Tuttavia, far girare catene di agenti su larga scala richiede la generazione di milioni di token (le unità fondamentali di testo elaborati dai modelli). Se ogni passaggio intermedio genera verbosità inutile, i costi operativi esplodono e la latenza diventa insostenibile.

Google risponde a questo problema intervenendo sull'architettura e sul fine-tuning dei modelli di classe "Flash", progettati per bilanciare velocità, qualità e costi per gli sviluppatori e il mondo aziendale.

![Grafica ufficiale di presentazione per Gemini 3.6 Flash, 3.5 Flash-Lite e 3.5 Flash Cyber](/blogai/backend/uploads/6a6003e772c74.webp)

I nuovi modelli della serie Flash presentati da Google per ottimizzare l'efficienza degli agenti AI.

## Gemini 3.6 Flash: Meno verbosità, più precisione nel coding e nelle analisi

Gemini 3.6 Flash nasce dal feedback diretto raccolto da sviluppatori ed aziende sulla precedente versione 3.5. La priorità dell'aggiornamento è l'ottimizzazione dell'efficienza dei token: secondo le rilevazioni indipendenti condotte dall'[Artificial Analysis Index](https://artificialanalysis.ai/models/gemini-3-6-flash), 3.6 Flash consuma il **17% in meno di token in uscita** rispetto a 3.5 Flash per completare gli stessi compiti. In specifici benchmark di sviluppo software come DeepSWE di [Datacurve](https://deepswe.datacurve.ai/), il risparmio sui token generati raggiunge picchi del **65%**.

Generare meno token non significa soltanto abbassare la fattura cloud, ma anche ridurre drasticamente i tempi di attesa dell'utente finale. Il modello richiede un numero inferiore di passaggi di ragionamento e di chiamate a strumenti esterni (_tool calls_) per portare a termine workflow articolati su più fasi.

**Costi di listino:** Gemini 3.6 Flash viene posizionato a **$1,50 per milione di token in ingresso** (input) e **$7,50 per milione di token in uscita** (output), consentendo di ridurre il costo complessivo per singola operazione agente.

### I benchmark di Gemini 3.6 Flash a confronto

Oltre al taglio dei consumi, la nuova versione registra un incremento tangibile nelle prestazioni pratiche rispetto a 3.5 Flash:

-   **Sviluppo Software e ML:** Nel test DeepSWE registra una precisione del 49% (contro il 37% di 3.5 Flash), riducendo le modifiche indesiderate al codice e i cicli di errore. Nel benchmark di ricerca sul machine learning MLE Bench balza dal 49,7% al **63,9%**.
    
-   **Interazione con sistemi operativi (Computer Use):** Raggiunge l'**83,0%** nel test OSWorld-Verified (rispetto al 78,4% precedente). La capacità di controllare direttamente le interfacce utente a livello desktop è ora integrata come strumento nativo client-side via API e in Gemini Enterprise.
    
-   **Elaborazione di documenti complessi:** Nel benchmark di lavoro concettuale GDPval-AA v2 sale a 1421 punti (rispetto a 1349), dimostrando elevate capacità di sintesi e comprensione multimodale su grafici, rendiconti finanziari e trascrizioni.
    

![Grafico di confronto delle prestazioni e dell'efficienza dei token tra Gemini 3.6 Flash e 3.5 Flash](/blogai/backend/uploads/6a6003e77c259.webp)

Valutazione comparativa dell'efficienza di calcolo e dell'accuratezza tra le generazioni Flash.

Aziende partner come Harvey (ambito legale), Hebbia (analisi finanziaria) e JetBrains (strumenti per sviluppatori) hanno già integrato il modello nei loro prodotti, confermando una netta riduzione del rumore nelle risposte e una maggiore affidabilità nella stesura di report articolati.

![Dettaglio metriche di qualità per Gemini 3.6 Flash sui diversi benchmark di settore](/blogai/backend/uploads/6a6003e79119c.webp)

Incrementi qualitativi ottenuti da Gemini 3.6 Flash sulle metriche di ragionamento e comprensione documentale.

## Gemini 3.5 Flash-Lite: La velocità d'esecuzione per gli agenti ad alto volume

Se la versione 3.6 Flash è pensata come modello di punta per compiti complessi, **Gemini 3.5 Flash-Lite** punta tutto su throughput elevato e latenza ultra-bassa. Raggiunge la velocità di **350 token al secondo in output** secondo le misurazioni di [Artificial Analysis](https://artificialanalysis.ai/models/gemini-3-5-flash-lite), diventando la scelta d'elezione per attività massive come l'estrazione dati da e-commerce, il parsing di scontrini o la scansione di documenti.

Con un prezzo fissato a **$0,30 per milione di token in input** e **$2,50 per milione in output**, questo modello offre un rapporto prezzo/prestazioni estremamente aggressivo. Gli sviluppatori possono configurare i livelli di ragionamento (_thinking levels_) su valori minimi per risposte istantanee o aumentarli quando il modello opera come sotto-agente all'interno di un sistema orchestrato.

> _\[Grafico interattivo — visibile nella versione web dell'articolo\]_

L'aspetto più sorprendente di 3.5 Flash-Lite è il sorpasso diretto nei confronti di modelli di fascia superiore della precedente architettura. Su SWE-Bench Pro tocca il **54,2%** superando il 49,6% ottenuto da Gemini 3 Flash. Su Terminal-Bench 2.1 registra il **54%** (contro il 31% della generazione 3.1 Flash-Lite) e su OSWorld-Verified tocca il **74,0%**.

![Grafico del confronto prestazionale tra Gemini 3.5 Flash-Lite e le versioni precedenti](/blogai/backend/uploads/6a6003e7c0d4c.webp)

Il salto prestazionale di Gemini 3.5 Flash-Lite rispetto alla versione 3.1 su compiti ad alto contesto e coding.

## Cybersecurity avanzata: Gemini 3.5 Flash Cyber e la piattaforma CodeMender

L'individuazione automatizzata delle vulnerabilità nel codice sorgente è diventata una corsa contro il tempo. I sistemi di analisi basati su IA scoprono falle di sicurezza a un ritmo spesso superiore rispetto alle capacità umane di correzione. Per colmare questo divario, Google introduce [Gemini 3.5 Flash Cyber](https://deepmind.google/blog/introducing-gemini-3-5-cyber-flash/), un modello specializzato derivato da 3.5 Flash e verticalizzato sulla rilevazione, validazione e risoluzione delle minacce informatiche.

Inserito all'interno di [CodeMender](https://deepmind.google/blog/introducing-codemender-an-ai-agent-for-code-security/) — un'infrastruttura agente distribuita che coordina più istanze specializzate per produrre report di sicurezza unificati — 3.5 Flash Cyber ottiene risultati di primo piano nel benchmark di sicurezza CyberGym.

![Risultati benchmark di Gemini 3.5 Flash Cyber nel test CyberGym all'interno dell'architettura CodeMender](/blogai/backend/uploads/6a6003e7d4189.webp)

Valutazione di Gemini 3.5 Flash Cyber sulle metriche di identificazione e remediation del codice vulnerabile.

**Accesso limitato per motivi di sicurezza:** Data la natura a doppio uso (_dual-use_) delle tecnologie difensive e offensive in ambito cyber, Gemini 3.5 Flash Cyber non sarà disponibile al pubblico generico. L'accesso sarà inizialmente riservato a governi e partner di sicurezza qualificati tramite un programma pilota a numero chiuso.

## Quadri di sintesi e architettura degli agenti

Per comprendere come posizionare i singoli modelli all'interno di una moderna architettura software basata su agenti, la seguente mappa illustra il flusso di instradamento consigliato in base alla tipologia di compito:

```mermaid
flowchart TD
  A[Prompt / Task Utente] --> B{Complessità Task}
  B -->|Alto Volume / Bassa Latenza| C[Gemini 3.5 Flash-Lite]
  B -->|Ragionamento / Agenti Complessi| D[Gemini 3.6 Flash]
  B -->|Cybersecurity & Remediation| E[CodeMender + 3.5 Flash Cyber]
  C --> F[Risultato Ottimizzato]
  D --> F
  E --> F
```

La tabella sottostante riassume le specifiche chiave, i costi di inferenza e i benchmark principali per ciascuna versione annunciata:

<table style="min-width: 125px;"><colgroup><col style="min-width: 25px;"><col style="min-width: 25px;"><col style="min-width: 25px;"><col style="min-width: 25px;"><col style="min-width: 25px;"></colgroup><tbody><tr><th colspan="1" rowspan="1"><p>Modello</p></th><th colspan="1" rowspan="1"><p>Focus Principale</p></th><th colspan="1" rowspan="1"><p>Prezzo Input (1M token)</p></th><th colspan="1" rowspan="1"><p>Prezzo Output (1M token)</p></th><th colspan="1" rowspan="1"><p>Metriche Chiave</p></th></tr><tr><td colspan="1" rowspan="1"><p><strong>Gemini 3.6 Flash</strong></p></td><td colspan="1" rowspan="1"><p>Efficienza token e ragionamento esteso</p></td><td colspan="1" rowspan="1"><p>$1,50</p></td><td colspan="1" rowspan="1"><p>$7,50</p></td><td colspan="1" rowspan="1"><p>-17% token output, 83,0% OSWorld, 63,9% MLE Bench</p></td></tr><tr><td colspan="1" rowspan="1"><p><strong>Gemini 3.5 Flash-Lite</strong></p></td><td colspan="1" rowspan="1"><p>Velocità (350 t/s) e volumi elevati</p></td><td colspan="1" rowspan="1"><p>$0,30</p></td><td colspan="1" rowspan="1"><p>$2,50</p></td><td colspan="1" rowspan="1"><p>54,2% SWE-Bench Pro, 54% Terminal-Bench 2.1</p></td></tr><tr><td colspan="1" rowspan="1"><p><strong>Gemini 3.5 Flash Cyber</strong></p></td><td colspan="1" rowspan="1"><p>Sicurezza del codice e bonifica falle</p></td><td colspan="1" rowspan="1"><p>Programma Pilota</p></td><td colspan="1" rowspan="1"><p>Programma Pilota</p></td><td colspan="1" rowspan="1"><p>Frontier score su CyberGym (in CodeMender)</p></td></tr></tbody></table>

### Pro

-   Miglioramento dell'efficienza dei token del 17% per la versione 3.6 Flash
-   Velocità di elaborazione fino a 350 token al secondo con la versione 3.5 Flash-Lite
-   Strumento nativo di navigazione e controllo del computer (Computer Use) integrato
-   Prezzi di inferenza estremamente competitivi a partire da $0,30 per milione di token

### Contro

-   Gemini 3.5 Flash Cyber resta riservato esclusivamente ad enti governativi e partner autorizzati
-   Gemini 3.5 Pro è ancora limitato ai test ad accesso ristretto

## Avvio dei lavori su Gemini 4 e disponibilità dei modelli

Accanto ai rilasci odierni, Google ha confermato che **Gemini 3.5 Pro** è in fase avanzata di test con un gruppo selezionato di partner aziendali e verrà distribuito su scala globale non appena supererà i criteri interni di validazione. Inoltre, la divisione guidata da Demis Hassabis ha ufficialmente avviato l'addestramento preliminare di **Gemini 4**, definendolo il ciclo di pre-training più imponente e ambizioso mai intrapreso dall'azienda.

I modelli 3.6 Flash e 3.5 Flash-Lite sono già accessibili attraverso le seguenti piattaforme e ambienti di sviluppo:

-   **Sviluppatori:** Tramite API in [Google AI Studio](https://aistudio.google.com/prompts/new_chat?model=gemini-3.6-flash), [Android Studio](https://developer.android.com/studio) e [Google Antigravity](https://antigravity.google/). Le indicazioni tecniche complete sono consultabili nella [Guida per sviluppatori](https://ai.google.dev/gemini-api/docs/latest-model).
    
-   **Aziende:** All'interno della piattaforma [Gemini Enterprise Agent Platform](https://console.cloud.google.com/agent-platform/studio/multimodal/) e nell'[applicazione Gemini Enterprise](https://cloud.google.com/gemini-enterprise?e=48754805).
    
-   **Utenti finali:** Tramite l'[applicazione Gemini](http://gemini.google/), mentre la versione 3.5 Flash-Lite è in fase di integrazione graduale all'interno di Google Search.
    

## Punti chiave

-   Google amplia la propria gamma di modelli compatti con il debutto di Gemini 3.6 Flash, 3.5 Flash-Lite e 3.5 Flash Cyber.
-   Gemini 3.6 Flash taglia del 17% il consumo di token di output rispetto a 3.5 Flash, incrementando la precisione nel coding e nelle analisi complesse.
-   Gemini 3.5 Flash-Lite genera 350 token al secondo e batte il vecchio Gemini 3 Flash su benchmark di sviluppo software come SWE-Bench Pro (54,2% vs 49,6%).
-   Gemini 3.5 Flash Cyber debutta insieme al sistema agente CodeMender per la bonifica automatica delle vulnerabilità, accessibile in via prioritaria al settore pubblico e difensivo.
-   I lavori per Gemini 4 sono ufficialmente iniziati con la più imponente fase di pre-addestramento mai realizzata da Google DeepMind.

## La valutazione della redazione: il pragmatismo vince sulla forza bruta

Il rilascio simultaneo di Gemini 3.6 Flash e 3.5 Flash-Lite segna un importante cambio di direzione nella strategia di Google DeepMind. La competizione tra i grandi produttori di intelligenza artificiale non si gioca più soltanto sui parametri lordi del modello frontier, ma sull'ingegnerizzazione dell'efficienza. Ridurre il verbosismo di un modello senza comprometterne il ragionamento significa rendere sostenibili dal punto di vista economico gli agenti AI complessi, che fino a pochi mesi fa risultavano troppo lenti e costosi per essere impiegati in produzione.

Gemini 3.6 Flash si dimostra un'opzione solida e conveniente per chiunque sviluppi workflow multi-agente, mentre la versione 3.5 Flash-Lite sorprende per la capacità di superare vecchi modelli di classe superiori su compiti pratici di programmazione. Per le aziende e gli sviluppatori italiani che costruiscono soluzioni SaaS e automazioni aziendali, il passaggio a questa nuova generazione di modelli offre una leva immediata per ridurre le spese d'infrastruttura senza rinunciare alla qualità finale.

## FAQ

### Quali sono i prezzi di Gemini 3.6 Flash e 3.5 Flash-Lite?

Gemini 3.6 Flash prevede un costo di $1,50 per milione di token in ingresso e $7,50 per milione in uscita. Gemini 3.5 Flash-Lite scende a $0,30 per milione in ingresso e $2,50 per milione in uscita.

### Cos'è il controllo del computer (Computer Use) nei modelli Gemini?

È una funzionalità integrata che consente agli agenti di interagire direttamente con le interfacce utente del sistema operativo, eseguendo azioni automatizzate su desktop via API Gemini o Gemini Enterprise.

### Come si comporta Gemini 3.5 Flash-Lite nei compiti di programmazione?

Raggiunge il 54,2% nel test SWE-Bench Pro e il 54% in Terminal-Bench 2.1, superando nettamente la precedente generazione 3.1 Flash-Lite e posizionandosi al di sopra di Gemini 3 Flash.

### Come è possibile provare i nuovi modelli da subito?

Gemini 3.6 Flash e 3.5 Flash-Lite sono già disponibili in Google AI Studio, Vertex AI/Enterprise, Android Studio, Google Antigravity e nell'app Gemini.

## Fonti e riferimenti

1.  [Google Keyword Blog - Introducing Gemini 3.6 Flash, 3.5 Flash-Lite, and 3.5 Flash Cyber](https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-3-6-flash-3-5-flash-lite-3-5-flash-cyber/)
2.  [Google DeepMind - Gemini 3.5 Cyber Flash](https://deepmind.google/blog/introducing-gemini-3-5-cyber-flash/)
3.  [Google DeepMind - CodeMender AI Agent](https://deepmind.google/blog/introducing-codemender-an-ai-agent-for-code-security/)

---

*Fonte: [https://ainsights.it/blog/nuovi-modelli-gemini-efficienza-velocita-agenti-ia](https://ainsights.it/blog/nuovi-modelli-gemini-efficienza-velocita-agenti-ia)*
