Physical Address
304 North Cardinal St.
Dorchester Center, MA 02124
Physical Address
304 North Cardinal St.
Dorchester Center, MA 02124

Due modelli generativi complementari appena rilasciati da Google portano la sintesi di immagini e video a costi e velocità da pipeline di produzione. Nano Banana 2 Lite genera un’immagine in 4 secondi a $0,034, e Gemini Omni Flash converte prompt testuali in clip video da dieci secondi via API. La combinazione dei due modelli permette di creare un video animato partendo da un prompt di testo in pochi istanti, con un costo complessivo inferiore al dollaro.
Google rende subito disponibili entrambi i modelli su Google AI Studio, Gemini API e Gemini Enterprise Agent Platform. Non è solo un aggiornamento tecnico: è un invito esplicito agli sviluppatori a costruire applicazioni che incatenano immagine e video in una sessione unica.
Nano Banana 2 Lite (identificato come gemini-3.1-flash-lite-image nelle API) è il modello più veloce ed economico della famiglia Nano Banana. Genera un’immagine a risoluzione 1K in 4 secondi al costo di $0,034, circa la metà del prezzo di Nano Banana 2 ($0,067) e circa un quarto di Nano Banana Pro ($0,134).
Google lo posiziona come rimpiazzo diretto del modello precedente (Gemini 2.5 Flash Image), considerato ormai obsoleto, e lo sta distribuendo anche su diversi prodotti consumer: AI Mode in Search, Gemini app, NotebookLM, Google Photos, Stitch, Google Flow e Google Ads. Nonostante la priorità data a latenza e costo, il modello mantiene una buona aderenza ai prompt, coerenza dei personaggi e leggibilità del testo nelle immagini generate.
L’intera famiglia Nano Banana ora si articola su tre modelli in produzione:
Gemini Omni Flash ( gemini-omni-flash-preview ) è il primo modello Google a combinare il ragionamento multimodale di Gemini con la generazione e l’editing video, ora disponibile per gli sviluppatori. Il costo è di $0,10 al secondo di output video, lo stesso prezzo di Veo 3.1 Fast.
Il modello accetta input misti di testo, immagini e video e consente un editing conversazionale in linguaggio naturale. Può sincronizzare testo e grafica con le azioni nel video e attinge alla conoscenza generale di Gemini per costruire narrazioni visive più coerenti. Al momento, la generazione è limitata a clip da 10 secondi.

Google segnala anche alcune limitazioni attuali dell’API: i riferimenti video fino a 3 secondi sono accettati nello schema ma non ancora processati correttamente dal modello; non sono supportati il caricamento di riferimenti audio e l’estensione di scene; la coerenza dei personaggi tra cambi di scena o movimenti di camera è ancora limitata.
Google spinge gli sviluppatori a usare i due modelli in sequenza: generare un’immagine con Nano Banana 2 Lite e passarla come riferimento a Gemini Omni Flash per animarla in un video. L’Interactions API, ora API predefinita di Google, preserva la cronologia della sessione e permette fino a tre modifiche consecutive sullo stesso contenuto.
Per dimostrare il flusso, DeepMind ha pubblicato tre app demo:
Entrambi i modelli utilizzano il watermarking SynthID per marcare i contenuti generati dall’intelligenza artificiale. La verifica è possibile tramite Gemini app, Gemini in Chrome o Google Search.
L’aspetto più rilevante è il costo marginale della filiera creativa. Un’immagine generata con Nano Banana 2 Lite costa $0,034. Se la si anima con Gemini Omni Flash per ottenere una clip di 5 secondi, il costo del video è di $0,50. Il costo totale dell’operazione è quindi di $0,534, poco più di metà del costo di un video generato interamente da zero per 10 secondi ($1,00). Sono cifre che rendono economicamente sensata la produzione automatizzata di asset video su larga scala, specialmente per e-commerce e advertising.
Rispetto alla traiettoria tracciata dai modelli più discussi delle ultime settimane (come GPT-5.6 Sol o GLM-5.2), Google non sta competendo sulla frontiera del ragionamento puro, ma sta abbassando la barriera d’ingresso allo sviluppo di applicazioni multimediali. L’integrazione nativa in API e l’ottimizzazione spinta su costo e latenza segnalano una strategia mirata alla quota di mercato tra gli sviluppatori, più che alla dimostrazione di capacità assolute.
La vera novità non è il singolo modello, ma la possibilità di orchestrare immagini e video in un’unica catena API, trasformando prompt testuali in clip animate a costi che rendono l’AI video una commodity per sviluppatori già da oggi.