AI video: nuovi modelli, world model NVIDIA e benchmark sulle capacità di ragionamento

Video AI: NVIDIA open source SANA-WM, benchmark svela i limiti fisici

I video generati da Seedance 2.0 di ByteDance, Veo 3.1 di Google e Sora 2 di OpenAI sono sempre più indistinguibili dalla realtà. Ma un nuovo benchmark sviluppato dalla Tsinghua University, pubblicato il 16 maggio 2026, dimostra che la qualità visiva non ha nulla a che fare con la comprensione del mondo fisico. Nel frattempo NVIDIA ha rilasciato in open source SANA-WM, un world model da 2,6 miliardi di parametri capace di generare clip da 60 secondi a 720p su una singola GPU.

WorldReasonBench: belli da vedere, ciechi alla fisica

WorldReasonBench non misura la qualità delle immagini, ma verifica se un modello genera video fisicamente e logicamente coerenti a partire da una scena iniziale. Il benchmark include circa 400 casi di test in quattro aree: world knowledge (fisica, meteo, norme culturali), scene con interazione umana (manipolazione di oggetti, dinamiche sociali), ragionamento logico (matematica, geometria, esperimenti scientifici) e ragionamento su informazioni grafiche (lettura di dati e diagrammi).

L'esempio più immediato: si mostra al modello un'immagine di una mela su un ramo e si chiede di farla cadere. Il video può essere visivamente perfetto e fisicamente sbagliato — la mela vola verso l'alto, esplode, o cade in linea retta invece di seguire una traiettoria curva. I sistemi commerciali ottengono punteggi circa doppi rispetto ai modelli open source, senza sovrapposizione statistica tra i due gruppi.

Seedance 2.0 ha ottenuto il punteggio più alto, vincendo in quasi nove prove su dieci durante i re-run statistici. Veo 3.1-Fast ha primeggiato nella categoria "world knowledge", Sora 2 in quella sulle scene centrate sugli esseri umani. Ma il dato più rilevante non riguarda la classifica: il ragionamento logico è la categoria più difficile per ogni modello testato, compresi quelli commerciali di punta. Il ragionamento su informazioni grafiche è il secondo punto critico, soprattutto quando il compito richiede la conservazione precisa di numeri e testo nel corso del video.

Un team di ricerca internazionale indipendente ha raggiunto conclusioni simili: Sora 2 e Veo 3.1 restano ben sotto le prestazioni umane nelle attività di ragionamento. Il salto da generatore di pixel a world model affidabile non è ancora avvenuto.

SANA-WM di NVIDIA: architettura e prestazioni su singola GPU

SANA-WM è un Diffusion Transformer (DiT) da 2,6 miliardi di parametri, disponibile su GitHub nel repository NVlabs/Sana. Genera video di 60 secondi a 720p con controllo metrico della camera a 6 gradi di libertà (6-DoF) e supporta tre varianti di inferenza su singola GPU. La versione distillata completa una clip da 60 secondi in 34 secondi su una RTX 5090 con quantizzazione NVFP4.

AI video: nuovi modelli, world model NVIDIA e benchmark sulle capacità di ragionamento
Scheda grafica GTX 1080 Ti, simbolo dell'accelerazione hardware alla base dei nuovi modelli di AI video. Foto di Nana Dua su Pexels

L'architettura si basa su quattro scelte tecniche principali:

  • Gated DeltaNet (GDN) frame-wise: sostituisce la maggior parte dei blocchi di attenzione softmax standard, che crescono quadraticamente con la lunghezza della sequenza. Il GDN mantiene uno stato ricorrente a dimensione costante con un meccanismo di decadimento che previene la deriva su sequenze di un minuto.
  • Dual-Branch Camera Control: un ramo grossolano (UCPE attention) cattura la struttura globale della traiettoria; un ramo fine (Plücker mixing) recupera il movimento intra-frame compresso dal VAE. Il risultato: errori di rotazione di 4,50° (percorso semplice) / 8,34° (percorso difficile) e di traslazione di 1,39 in entrambi i percorsi sul benchmark dedicato.
  • Pipeline a due stadi: un refiner inizializzato da LTX-2 (17B parametri) con LoRA rank-384 corregge gli artefatti strutturali del primo stadio, riducendo il degrado di qualità lungo la sequenza (ΔIQ) da 3,79 a 1,17 sul percorso semplice e da 3,09 a 0,31 su quello complesso.
  • Dataset con 212.975 clip annotate con pose 6-DoF a scala metrica, costruito fondendo due stimatori di profondità, Pi3X e MoGe-2.

Su un cluster di 8 GPU H100, SANA-WM elabora 22 video all'ora contro i 0,6 di LingBot-World — un vantaggio di throughput di 36 volte — restando entro un budget di memoria di 74,7 GB.

Runway punta ai world model per sfidare Google

In questo contesto si inserisce Runway, la startup fondata a New York nel 2018 da Anastasis Germanidis, Cristóbal Valenzuela e Alejandro Matamala Ortiz — tutti e tre ex studenti dell'ITP di NYU. La società è valutata 5,3 miliardi di dollari, ha raccolto 860 milioni di dollari complessivi incluso un round da 315 milioni a febbraio 2026 con AMD Ventures e NVIDIA, e ha aggiunto 40 milioni di ARR nel secondo trimestre del 2026.

Runway ha lanciato il suo primo world model a dicembre 2025 e prevede un secondo lancio nel corso del 2026. Il co-CEO Germanidis argomenta che i modelli linguistici distillano la conoscenza umana esistente, ma per superarla servono sistemi addestrati su dati osservativi del mondo fisico. La sua ambizione di lungo periodo: world model biologici per la ricerca anti-invecchiamento.

Il principale ostacolo concreto non è la visione, ma il compute. Runway ha accordi con CoreWeave e NVIDIA, ma non ha confermato l'accesso a cluster dedicati di larga scala, indispensabili per l'addestramento di modelli frontier. Google, con Veo per il video commerciale e Genie per i world model, rimane il concorrente diretto su entrambi i fronti.

Perché questa convergenza conta

Il campo si sta biforcando lungo due assi distinti. Il primo è l'efficienza computazionale: SANA-WM dimostra che è possibile fare inferenza di qualità frontier su hardware consumer, abbassando drasticamente la barriera d'accesso alla generazione video di lunga durata. Il secondo è il divario tra ciò che i modelli sanno mostrare e ciò che sanno capire: WorldReasonBench fissa con dati precisi una lacuna che finora era solo intuitiva. Per le applicazioni che contano davvero — robotica, simulazione scientifica, digital twin — la bellezza visiva non basta. Serve causalità.

Il benchmark di Tsinghua e il world model di NVIDIA, letti insieme, tracciano la rotta: la prossima frontiera non è la risoluzione dei frame, ma la coerenza di ciò che accade tra un frame e l'altro.

Francesco Leone
Francesco Leone

Francesco Leone è un esperto in Intelligenza Artificiale con una profonda conoscenza in Machine Learning e Deep Learning. Attraverso la sua esperienza, ha contribuito allo sviluppo di soluzioni innovative in ambito di elaborazione del linguaggio naturale e visione artificiale, mirando a trasformare il modo in cui interagiamo con la tecnologia. Attivo nel settore con pubblicazioni e progetti su https://ital-ia.it/, Francesco si dedica alla ricerca e all'applicazione di algoritmi avanzati per rendere i sistemi più intelligenti e accessibili.

Articoli: 553

Lascia una risposta

Il tuo indirizzo email non sarà pubblicato. I campi obbligatori sono contrassegnati *