DiffusionGemma: Google DeepMind accelera generazione testo di 4x

DiffusionGemma: Google accelera la generazione testo di 4x

Google DeepMind non ha semplicemente rilasciato un modello più veloce: ha portato il paradigma della diffusione — finora esclusivo delle immagini AI — al testo su larga scala. DiffusionGemma, presentato il 10 giugno 2026 con licenza open Apache 2.0, genera blocchi di 256 token in parallelo invece di procedere parola per parola, raggiungendo oltre 1.000 token al secondo su NVIDIA H100 in modalità single-user. Il risultato ridefinisce cosa è possibile fare con un modello da 26 miliardi di parametri su hardware consumer.

Come funziona la diffusione testuale

DiffusionGemma applica al linguaggio lo stesso principio dei generatori di immagini AI: parte da un blocco di 256 token casuali e lo raffina attraverso più passaggi iterativi, bloccando progressivamente i token corretti fino a far emergere testo leggibile. Il meccanismo, derivato dalla ricerca Gemini Diffusion di Google DeepMind, è l'opposto dei normali LLM autoregressivi, che procedono come una macchina da scrivere — un token alla volta, sempre da sinistra a destra.

La struttura interna è quella di un Mixture of Experts: 26 miliardi di parametri totali, di cui solo 3,8 miliardi vengono attivati per ogni passaggio durante l'inferenza — circa il 14,6% della rete totale. Questo permette di far girare il modello quantizzato entro 18 GB di VRAM su GPU consumer di fascia alta.

Un vantaggio strutturale rispetto ai modelli autoregressivi è l'attenzione bidirezionale: poiché tutti e 256 i token vengono elaborati simultaneamente, ciascuno può fare riferimento a tutti gli altri, compresi quelli che compaiono più avanti. I modelli tradizionali possono solo guardare indietro.

Velocità reale: i numeri per hardware

Il salto di prestazioni ha una spiegazione precisa. Nei modelli autoregressivi, l'inferenza per singolo utente è spesso limitata dalla banda di memoria: le unità di calcolo restano in attesa dei dati. Elaborando 256 token contemporaneamente, DiffusionGemma sposta il collo di bottiglia verso la potenza di calcolo pura, tenendo il chip effettivamente occupato.

I valori dichiarati da Google e NVIDIA:

HardwareToken/secondo
NVIDIA H100 (singola richiesta)1.000+
NVIDIA GeForce RTX 5090700+
DGX Station~800
DGX Spark (deskside)~150

Nei benchmark interni di Google, DiffusionGemma gira circa 3,5 volte più veloce di un Gemma 4 della stessa dimensione — leggermente meno del moltiplicatore massimo di 4x indicato nel comunicato ufficiale, che si raggiunge nelle condizioni ottimali su acceleratori dedicati. Google stessa raccomanda il Gemma 4 standard quando la qualità è prioritaria: DiffusionGemma cede terreno su tutti i test di accuratezza rispetto ai modelli autoregressivi comparabili.

DiffusionGemma: Google DeepMind accelera generazione testo di 4x
Processori GPU moderni per elaborazione parallela ad alta prestazione. Foto di Nana Dua su Pexels

Dove il vantaggio tiene e dove si inverte

Il guadagno in velocità vale solo in scenari local o low-concurrency. In cloud con molte richieste parallele, i modelli autoregressivi saturano già l'hardware tramite batching, e DiffusionGemma può aumentare i costi operativi. Google lo posiziona esplicitamente come strumento per ricercatori e sviluppatori in ambienti locali.

Dove il modello mostra punti di forza specifici:

  • Editing inline: modifica porzioni di testo mantenendo il contesto circostante
  • Code infilling: inserisce codice all'interno di blocchi esistenti
  • Strutture non lineari: sequenze di aminoacidi, grafi matematici
  • Formattazione markdown complessa: chiude correttamente strutture aperte grazie alla visione globale del blocco

Un caso concreto riportato da Google: Unsloth ha realizzato un fine-tune di DiffusionGemma per risolvere Sudoku 9×9, task su cui i modelli autoregressivi faticano perché ogni cella dipende da valori non ancora scritti. Il modello base commetteva 31 errori su 81 celle in 30 passaggi di denoising; il fine-tune risolveva il puzzle completamente.

Pesi aperti, ecosistema già attivo

Il modello è distribuito su Hugging Face con licenza Apache 2.0 e funziona sin dal lancio con HuggingFace Transformers, vLLM (con integrazione Red Hat) e MLX. Per il fine-tuning, Google ha rilasciato tutorial basati su Hackable Diffusion (toolbox JAX modulare), con supporto per Unsloth e NVIDIA NeMo. Il supporto per llama.cpp è in arrivo.

NVIDIA ha ottimizzato il modello per l'intera gamma hardware: quantizzazione per GeForce RTX 5090 e RTX 4090, kernel NVFP4 per architetture Hopper e Blackwell, compatibilità con DGX Spark e DGX Station. È disponibile anche tramite l'API cloud NVIDIA NIM — dove il blogger tecnico Simon Willison ha generato 2.409 token in 4,4 secondi, a una velocità di almeno 500 token al secondo — e tramite il Gemini Enterprise Agent Platform Model Garden.

Il contesto non è isolato: la startup Inception persegue lo stesso approccio con Mercury 2, distribuito a inizio 2026 come primo modello di ragionamento basato su diffusione testuale.

La scommessa concreta per sviluppatori con GPU dedicata è questa: con 700+ token al secondo su RTX 5090, applicazioni di editing live o generazione interattiva diventano tecnicamente praticabili per la prima volta. Non si tratta solo di velocità — è il cambio di architettura che sblocca l'infilling e la generazione bidirezionale, funzionalità che i modelli token-by-token non possono offrire per ragioni strutturali.

Fonti

Francesco Leone
Francesco Leone

Francesco Leone è un esperto in Intelligenza Artificiale con una profonda conoscenza in Machine Learning e Deep Learning. Attraverso la sua esperienza, ha contribuito allo sviluppo di soluzioni innovative in ambito di elaborazione del linguaggio naturale e visione artificiale, mirando a trasformare il modo in cui interagiamo con la tecnologia. Attivo nel settore con pubblicazioni e progetti su https://ital-ia.it/, Francesco si dedica alla ricerca e all'applicazione di algoritmi avanzati per rendere i sistemi più intelligenti e accessibili.

Articoli: 553

Lascia una risposta

Il tuo indirizzo email non sarà pubblicato. I campi obbligatori sono contrassegnati *