Google ha recentemente svelato Gemini Omni, un modello multimodale capace di trasformare immagini, testo e audio in video di alta qualità; tuttavia, per ottenere risultati professionali non basta scrivere istruzioni standard, ma occorre adottare la mentalità di un regista cinematografico.

Gemini Omni on a Macbook M1.
Gemini Omni in esecuzione su un MacBook M1 durante i test di generazione video.

Fornire sempre un riferimento visivo

Il modello inferisce meglio di quanto immagini

Gemini Omni è un modello visivo nativo. Il miglioramento più evidente nella qualità dell'output si ottiene fornendo un'immagine di base invece di affidarsi al solo testo. In un test pratico, caricando lo schizzo di un cane in stile cartoon, il modello ha "inferito" (ovvero ha dedotto logicamente le informazioni mancanti basandosi sui dati forniti) le caratteristiche necessarie per trasformarlo in un personaggio animato fluido, simile a una produzione Disney.

L'IA ha preservato dettagli specifici come le orecchie floscie, le macchie nere e il collare rosso, interpretando correttamente la "personalità" del disegno. Al contrario, un prompt (l'istruzione testuale data all'IA) puramente testuale come "crea un cane bipede animato" lascia troppo spazio all'interpretazione, producendo spesso risultati incoerenti o visivamente disturbanti. L'immagine funge da ancora creativa, limitando le allucinazioni del modello.

Concentrarsi su pochi soggetti rilevanti

Meno dettagli portano a una maggiore qualità

Un errore comune è sovraccaricare il prompt di dettagli superflui, sperando in un video più ricco. In realtà, Gemini Omni si comporta più come una telecamera fisica che come un modello linguistico tradizionale (LLM). Se si inseriscono sei soggetti diversi, l'IA deve dividere la sua "attenzione" computazionale tra troppi elementi, perdendo precisione su ciascuno.

Per video efficaci, come le dimostrazioni di prodotto, è fondamentale specificare quale sia il focus primario. Indicare chiaramente l'oggetto principale permette al modello di capire che gli elementi di sfondo devono essere secondari. Questo approccio evita distrazioni visive e garantisce che la "messa a fuoco" virtuale resti coerente per tutta la durata della clip.

A still from a video generated with Gemini Omni.
Un fermo immagine tratto da un video generato con Gemini Omni, che mostra l'elevata qualità cinematografica ottenibile.

Strutturare il prompt come un'inquadratura cinematografica

Dirigere l'IA come un operatore video

Con Gemini Omni è più efficiente risolvere i dubbi creativi prima di avviare la generazione piuttosto che cercare di correggere il video a posteriori. La qualità del progetto migliora sensibilmente quando si hanno risposte chiare a domande tipiche della cinematografia:

  • Dove è posizionata la telecamera?

  • Qual è il movimento del soggetto?

  • Quale atmosfera o "mood" deve trasmettere la scena?

  • L'inquadratura è un campo largo, un primo piano o un'osservazione naturale?

Fornire queste coordinate tecniche riduce il margine di errore del modello in termini di angolazione, illuminazione e composizione. Pensare in termini di "shot" (inquadratura) permette di ottenere video che sembrano girati dal vivo invece che generati artificialmente.

Utilizzare i prompt negativi per mantenere il controllo

Specificare cosa evitare è fondamentale quanto dire cosa fare

Gemini Omni mantiene il "contesto" della conversazione, ovvero ricorda le generazioni precedenti per garantire coerenza stilistica durante un progetto. Tuttavia, questa caratteristica può diventare un limite se si desidera cambiare drasticamente direzione: il modello tende a riproporre angolazioni e luci dei video precedenti, creando un effetto di uniformità indesiderato.

Per evitare questo automatismo, è necessario introdurre dei vincoli o "negative prompt" (istruzioni su cosa escludere). Se il modello continua a proporre uno stile troppo derivativo o ripetitivo, bisogna esplicitamente vietare determinati colori, movimenti di camera o atmosfere. Questo reset permette di recuperare il controllo creativo senza dover iniziare una nuova chat da zero.

Il nostro verdetto
4.8/ 5

Gemini Omni: Il nuovo standard del video AI

Gemini Omni si conferma uno strumento straordinario, capace di generare video che sembrano usciti da un film di fantascienza. La chiave per sbloccare il suo vero potenziale non risiede nell'ingegneria dei prompt tradizionale, ma nella capacità dell'utente di agire come un vero e proprio regista cinematografico.

Posso usare Gemini Omni solo con il testo?
Sì, ma i risultati sono meno prevedibili. L'uso di un'immagine di riferimento aiuta il modello a mantenere la coerenza visiva.
Cosa si intende per pensare come un regista?
Significa specificare dettagli tecnici come il tipo di inquadratura (primo piano, campo lungo), l'illuminazione e il movimento della camera nel prompt.
Perché i miei video sembrano tutti uguali?
Il modello tende a mantenere il contesto delle generazioni precedenti. Per cambiare stile, usa istruzioni specifiche su cosa non vuoi includere (prompt negativi).
Gemini Omni può generare video da audio?
Sì, è un modello multimodale che può accettare testo, immagini e clip audio come input per creare un output video.

Fonti e riferimenti

  1. Google Gemini Omni Official
  2. Hands-on with Gemini Omni video generation