---
title: "Gemini 3.5 Flash: l'IA che controlla il PC è ora una realtà nativa"
date: "2026-06-25"
category: "Intelligenza Artificiale"
tags: ["agenti ai", "automazione", "gemini 3.5 flash", "intelligenza artificiale"]
author: "Giuseppe Carruezzo"
description: "Google integra la funzione computer use in Gemini 3.5 Flash: gli agenti AI possono ora navigare e operare sul desktop in modo autonomo e sicuro."
source: "https://ainsights.it/blog/gemini-3-5-flash-controllo-pc-nativo"
---

# Gemini 3.5 Flash: l'IA che controlla il PC è ora una realtà nativa

![Gemini 3.5 Flash: l'IA che controlla il PC è ora una realtà nativa](/blogai/backend/uploads/6a3cdb6bc5ee8.webp)

Un modello di intelligenza artificiale che fa clic, scrive e naviga sul desktop al posto tuo non è più una demo futuristica da laboratorio: Google ha integrato nativamente il controllo del PC all'interno di Gemini 3.5 Flash. Questa mossa sposta l'automazione software verso la nuova era degli agenti autonomi, pronti a operare su browser, mobile e desktop con la velocità e l'efficienza di un modello ultra-leggero.

## La svolta di Google: il controllo del PC diventa nativo

Ieri, 24 giugno 2026, Mateo Quiros (Product Manager di Google DeepMind) ha annunciato una novità destinata a ridefinire lo sviluppo software: la funzionalità di **computer use** (letteralmente "uso del computer") è ora uno strumento nativo integrato in **Gemini 3.5 Flash**. Fino ad oggi, gli sviluppatori che desideravano creare agenti in grado di controllare lo schermo dovevano affidarsi al modello specialistico stand-alone Gemini 2.5 computer use. Con questa integrazione, l'intera pipeline di visione, ragionamento e azione viene eseguita direttamente dal modello Flash standard.

Questo significa che Gemini, già ampiamente utilizzato per il _function calling_ (la capacità di richiamare funzioni di codice esterne) e per la connessione in tempo reale a Google Search o Google Maps, ora può agire come un vero e proprio operatore umano virtuale. Gli sviluppatori possono sfruttare le API per costruire agenti in grado di vedere cosa succede sullo schermo, pianificare i passaggi logici necessari e simulare l'uso di mouse e tastiera in qualsiasi ambiente software.

## Prestazioni a confronto: il benchmark OSWorld

Per misurare l'efficacia di un agente AI nell'interazione con un sistema operativo reale, la comunità scientifica utilizza il benchmark **OSWorld**. Questo test mette alla prova i modelli su flussi di lavoro complessi e "a lungo raggio" (_long-horizon tasks_), che richiedono decine di passaggi consecutivi all'interno di sistemi desktop standard (come l'installazione di software, la gestione di fogli di calcolo o il trasferimento di dati tra applicazioni diverse).

I risultati ottenuti mostrano un netto incremento di affidabilità, rendendo Gemini 3.5 Flash uno dei motori più competitivi per l'automazione aziendale. A differenza dei sistemi di automazione tradizionali (RPA - _Robotic Process Automation_), l'approccio basato sul computer use non richiede la scrittura di regole rigide o il tracciamento dei selettori HTML di una pagina web: l'AI "guarda" lo schermo esattamente come farebbe un utente umano, adattandosi istantaneamente se un pulsante cambia colore o viene spostato di posizione.

<table style="min-width: 75px;"><colgroup><col style="min-width: 25px;"><col style="min-width: 25px;"><col style="min-width: 25px;"></colgroup><tbody><tr><th colspan="1" rowspan="1"><p>Caratteristica</p></th><th colspan="1" rowspan="1"><p>RPA Tradizionale</p></th><th colspan="1" rowspan="1"><p>Gemini 3.5 Flash (Computer Use)</p></th></tr><tr><td colspan="1" rowspan="1"><p><strong>Adattabilità al layout</strong></p></td><td colspan="1" rowspan="1"><p>Si rompe se l'interfaccia grafica subisce modifiche minimi.</p></td><td colspan="1" rowspan="1"><p>Si adatta autonomamente grazie alla comprensione visiva dello schermo.</p></td></tr><tr><td colspan="1" rowspan="1"><p><strong>Integrazione applicativa</strong></p></td><td colspan="1" rowspan="1"><p>Richiede script specifici o API dedicate per ogni software.</p></td><td colspan="1" rowspan="1"><p>Interagisce direttamente tramite interfaccia grafica su browser, desktop e mobile.</p></td></tr><tr><td colspan="1" rowspan="1"><p><strong>Gestione degli imprevisti</strong></p></td><td colspan="1" rowspan="1"><p>Richiede la programmazione preventiva di ogni scenario di errore.</p></td><td colspan="1" rowspan="1"><p>Risolve problemi logici in tempo reale ri-pianificando le azioni.</p></td></tr></tbody></table>

## Casi d'uso pratici: dal testing all'accessibilità

L'integrazione di questa tecnologia sblocca scenari di automazione applicata che fino a poco tempo fa richiedevano ore di lavoro manuale. Google ha mostrato due scenari concreti di utilizzo del modello:

-   **Analisi ed estrazione dati dalle applicazioni:** Gemini 3.5 Flash è in grado di navigare in un'applicazione complessa (come l'app Gemini stessa), analizzarne le sezioni e restituire un elenco categorizzato di funzionalità senza alcun input strutturato a monte.
    
-   **Audit di accessibilità automatizzati:** Il modello può scorrere intere pagine di documentazione tecnica per verificare la conformità agli standard di accessibilità web, individuando bug visivi, problemi di contrasto o barriere di navigazione per utenti con disabilità.
    

Queste capacità sono particolarmente preziose per le imprese che devono eseguire continuativamente test del software (_continuous software testing_) o gestire enormi volumi di lavoro amministrativo su applicazioni professionali non dotate di API pubbliche.

## Sicurezza e Prompt Injection: la strategia di Google

Lasciare che un'intelligenza artificiale controlli autonomamente mouse e tastiera espone i sistemi a gravi rischi di sicurezza. Il pericolo principale è rappresentato dalle **prompt injection** indirette: un attacco informatico in cui un testo malevolo, nascosto ad esempio all'interno di una pagina web visitata dall'agente, riesce a sovrascrivere le istruzioni di sistema originarie, spingendo l'AI a compiere azioni dannose (come eliminare file o inviare dati riservati).

**Attenzione:** L'esecuzione di agenti AI dotati di controllo desktop in ambienti di produzione reali richiede l'adozione di un approccio di sicurezza multilivello (_defense-in-depth_).

Per mitigare questi rischi, Google ha implementato due difese principali su Gemini 3.5 Flash:

1.  **Addestramento avversario mirato (Targeted Adversarial Training):** Il modello è stato addestrato per riconoscere e ignorare i tentativi di manipolazione nascosti nei testi visibili sullo schermo.
    
2.  **Sistemi di salvaguardia aziendali (Enterprise Safeguards):** Gli sviluppatori possono attivare l'arresto automatico delle attività se viene identificata una potenziale injection o forzare la richiesta di una conferma esplicita da parte di un supervisore umano (_human-in-the-loop_) prima di eseguire azioni sensibili o irreversibili.
    

## Come testare e sviluppare con Gemini 3.5 Flash oggi

Per chi vuole toccare con mano le potenzialità della tecnologia, le risorse sono già attive:

-   **Demo Web Gratuita:** È possibile testare il controllo del browser in tempo reale all'interno di un ambiente sicuro e isolato (_sandbox_) ospitato da Browserbase su [gemini.browserbase.com](http://gemini.browserbase.com/).
    
-   **Reference Implementation:** Google ha rilasciato un modello di implementazione di riferimento su GitHub alla repository [computer-use-preview](https://github.com/google-gemini/computer-use-preview) per accelerare lo sviluppo.
    
-   **Accesso Cloud:** La funzionalità è disponibile tramite le API ufficiali di Gemini e sulla piattaforma aziendale Gemini Enterprise Agent Platform.
    

## Punti chiave

-   Integrazione nativa: la funzionalità di controllo del computer passa da modello stand-alone a strumento integrato in Gemini 3.5 Flash, riducendo tempi di sviluppo e latenza.
-   Sicurezza multilivello: Google introduce l'addestramento avversario mirato e sistemi automatici di arresto per prevenire attacchi di prompt injection.
-   Pronto all'uso: gli sviluppatori possono iniziare subito i test grazie a una demo interattiva su Browserbase e alla reference implementation disponibile su GitHub.

### Un passo da gigante per gli agenti autonomi — 4.5/5

L'integrazione di 'computer use' all'interno di un modello ultra-rapido ed economico come Gemini 3.5 Flash democratizza lo sviluppo di agenti capaci di usare il PC come un essere umano. Nonostante i rischi intrinseci legati alla sicurezza delle prompt injection, le nuove misure preventive rendono questo strumento il punto di riferimento attuale per l'automazione di livello enterprise.

## FAQ

### Cos'è la funzione 'computer use' di Gemini 3.5 Flash?

È una tecnologia integrata che consente al modello AI di interagire con lo schermo di un computer, simulando azioni umane come fare clic su pulsanti, digitare testo e navigare tra diverse applicazioni desktop o web.

### In cosa si differenzia dal precedente modello Gemini 2.5?

Prima questa capacità richiedeva l'uso di un modello stand-alone specializzato (Gemini 2.5 computer use). Ora è integrata nativamente all'interno di Gemini 3.5 Flash, che garantisce maggiore velocità, costi inferiori e una gestione più fluida delle chiamate di funzione.

### Come viene protetto il sistema dalle minacce di prompt injection?

Google ha addestrato il modello con tecniche avversarie mirate. Inoltre, offre due sistemi di salvaguardia opzionali: la richiesta di conferma utente prima di eseguire azioni sensibili e l'arresto automatico del processo qualora venga intercettata un'istruzione dannosa nascosta.

### Come posso iniziare a testare questa funzionalità?

Puoi provare una demo interattiva gratuita ospitata da Browserbase sul sito gemini.browserbase.com o scaricare la reference implementation ufficiale di Google disponibile su GitHub.

## Fonti e riferimenti

1.  [Introducing computer use in Gemini 3.5 Flash - Google DeepMind](https://blog.google/innovation-and-ai/models-and-research/gemini-models/introducing-computer-use-gemini-3-5-flash/)
2.  [Documentazione Ufficiale Gemini API Computer Use](https://ai.google.dev/gemini-api/docs/interactions/computer-use)
3.  [Repository GitHub - Computer Use Preview](https://github.com/google-gemini/computer-use-preview)

---

*Fonte: [https://ainsights.it/blog/gemini-3-5-flash-controllo-pc-nativo](https://ainsights.it/blog/gemini-3-5-flash-controllo-pc-nativo)*
