Physical Address
304 North Cardinal St.
Dorchester Center, MA 02124
Physical Address
304 North Cardinal St.
Dorchester Center, MA 02124

Secondo indiscrezioni non ancora verificate, il 26 luglio 2026 Black Forest Labs avrebbe rilasciato FLUX 3, un modello foundation multimodale in grado di apprendere da immagini, video e audio in un’unica architettura. Sarebbe il primo modello della famiglia FLUX a integrare nativamente l’elaborazione di filmati e suoni, segnando il passaggio da una linea finora focalizzata soltanto sulle immagini a una copertura potenzialmente completa del contenuto multimediale. La notizia, riportata da fonti non ufficiali, non ha al momento riscontri diretti: la pagina di MarkTechPost che ne parlava risulta inaccessibile e mancano comunicati o documentazione ufficiale di Black Forest Labs.
Stando alle voci, una singola rete apprenderebbe simultaneamente da dati visivi e sonori, eliminando la necessità di modelli separati per ciascun tipo di contenuto. Le versioni precedenti della famiglia FLUX erano ottimizzate esclusivamente per le immagini; con un ipotetico FLUX 3, Black Forest Labs estenderebbe la stessa base addestrata a video e audio, con l’obiettivo di mantenere coerenza interna e semplificare l’infrastruttura di deployment. In assenza di conferme, queste caratteristiche restano da valutare.

Se confermato, disporre di un unico modello per immagini, video e audio ridurrebbe il sovraccarico di dover orchestrare pipeline distinte. Operazioni come la sincronizzazione labiale, la generazione di colonne sonore o l’analisi congiunta di scene e dialoghi potrebbero essere realizzate senza passaggi di raccordo tra modelli diversi. Black Forest Labs, secondo le indiscrezioni, punterebbe così a un ambito in cui la convergenza multimodale sta diventando requisito competitivo, ma nessun dato tecnico è disponibile per confermare l’effettivo funzionamento.
L’assenza di dati pubblici sulle prestazioni non consente confronti diretti, ma un’architettura condivisa tra immagini, video e audio rappresenterebbe un vantaggio potenziale in termini di coerenza degli output. Se l’addestramento congiunto riuscisse a evitare interferenze tra le modalità, un simile modello potrebbe offrire una sincronia multimodale superiore rispetto a soluzioni che combinano reti indipendenti. La sfida principale resterebbe mantenere qualità uniforme su tutte e tre le modalità senza penalizzarne nessuna: ipotesi tutta da verificare.
In attesa di comunicazioni ufficiali, il presunto FLUX 3 viene inquadrato come l’evoluzione con cui Black Forest Labs abbandonerebbe la specializzazione sulle immagini per competere direttamente nel segmento dei modelli multimodali. L’integrazione nativa di video e audio in un’unica architettura è, allo stato attuale, soltanto un indiscrezione non verificabile, e l’intera ricostruzione si basa su un articolo di MarkTechPost non più accessibile.