Physical Address
304 North Cardinal St.
Dorchester Center, MA 02124
Physical Address
304 North Cardinal St.
Dorchester Center, MA 02124

Google DeepMind non ha semplicemente rilasciato un modello più veloce: ha portato il paradigma della diffusione — finora esclusivo delle immagini AI — al testo su larga scala. DiffusionGemma, presentato il 10 giugno 2026 con licenza open Apache 2.0, genera blocchi di 256 token in parallelo invece di procedere parola per parola, raggiungendo oltre 1.000 token al secondo su NVIDIA H100 in modalità single-user. Il risultato ridefinisce cosa è possibile fare con un modello da 26 miliardi di parametri su hardware consumer.
DiffusionGemma applica al linguaggio lo stesso principio dei generatori di immagini AI: parte da un blocco di 256 token casuali e lo raffina attraverso più passaggi iterativi, bloccando progressivamente i token corretti fino a far emergere testo leggibile. Il meccanismo, derivato dalla ricerca Gemini Diffusion di Google DeepMind, è l'opposto dei normali LLM autoregressivi, che procedono come una macchina da scrivere — un token alla volta, sempre da sinistra a destra.
La struttura interna è quella di un Mixture of Experts: 26 miliardi di parametri totali, di cui solo 3,8 miliardi vengono attivati per ogni passaggio durante l'inferenza — circa il 14,6% della rete totale. Questo permette di far girare il modello quantizzato entro 18 GB di VRAM su GPU consumer di fascia alta.
Un vantaggio strutturale rispetto ai modelli autoregressivi è l'attenzione bidirezionale: poiché tutti e 256 i token vengono elaborati simultaneamente, ciascuno può fare riferimento a tutti gli altri, compresi quelli che compaiono più avanti. I modelli tradizionali possono solo guardare indietro.
Il salto di prestazioni ha una spiegazione precisa. Nei modelli autoregressivi, l'inferenza per singolo utente è spesso limitata dalla banda di memoria: le unità di calcolo restano in attesa dei dati. Elaborando 256 token contemporaneamente, DiffusionGemma sposta il collo di bottiglia verso la potenza di calcolo pura, tenendo il chip effettivamente occupato.
I valori dichiarati da Google e NVIDIA:
| Hardware | Token/secondo |
|---|---|
| NVIDIA H100 (singola richiesta) | 1.000+ |
| NVIDIA GeForce RTX 5090 | 700+ |
| DGX Station | ~800 |
| DGX Spark (deskside) | ~150 |
Nei benchmark interni di Google, DiffusionGemma gira circa 3,5 volte più veloce di un Gemma 4 della stessa dimensione — leggermente meno del moltiplicatore massimo di 4x indicato nel comunicato ufficiale, che si raggiunge nelle condizioni ottimali su acceleratori dedicati. Google stessa raccomanda il Gemma 4 standard quando la qualità è prioritaria: DiffusionGemma cede terreno su tutti i test di accuratezza rispetto ai modelli autoregressivi comparabili.

Il guadagno in velocità vale solo in scenari local o low-concurrency. In cloud con molte richieste parallele, i modelli autoregressivi saturano già l'hardware tramite batching, e DiffusionGemma può aumentare i costi operativi. Google lo posiziona esplicitamente come strumento per ricercatori e sviluppatori in ambienti locali.
Dove il modello mostra punti di forza specifici:
Un caso concreto riportato da Google: Unsloth ha realizzato un fine-tune di DiffusionGemma per risolvere Sudoku 9×9, task su cui i modelli autoregressivi faticano perché ogni cella dipende da valori non ancora scritti. Il modello base commetteva 31 errori su 81 celle in 30 passaggi di denoising; il fine-tune risolveva il puzzle completamente.
Il modello è distribuito su Hugging Face con licenza Apache 2.0 e funziona sin dal lancio con HuggingFace Transformers, vLLM (con integrazione Red Hat) e MLX. Per il fine-tuning, Google ha rilasciato tutorial basati su Hackable Diffusion (toolbox JAX modulare), con supporto per Unsloth e NVIDIA NeMo. Il supporto per llama.cpp è in arrivo.
NVIDIA ha ottimizzato il modello per l'intera gamma hardware: quantizzazione per GeForce RTX 5090 e RTX 4090, kernel NVFP4 per architetture Hopper e Blackwell, compatibilità con DGX Spark e DGX Station. È disponibile anche tramite l'API cloud NVIDIA NIM — dove il blogger tecnico Simon Willison ha generato 2.409 token in 4,4 secondi, a una velocità di almeno 500 token al secondo — e tramite il Gemini Enterprise Agent Platform Model Garden.
Il contesto non è isolato: la startup Inception persegue lo stesso approccio con Mercury 2, distribuito a inizio 2026 come primo modello di ragionamento basato su diffusione testuale.
La scommessa concreta per sviluppatori con GPU dedicata è questa: con 700+ token al secondo su RTX 5090, applicazioni di editing live o generazione interattiva diventano tecnicamente praticabili per la prima volta. Non si tratta solo di velocità — è il cambio di architettura che sblocca l'infilling e la generazione bidirezionale, funzionalità che i modelli token-by-token non possono offrire per ragioni strutturali.