Physical Address
304 North Cardinal St.
Dorchester Center, MA 02124
Physical Address
304 North Cardinal St.
Dorchester Center, MA 02124

OpenAI ha rilasciato oggi GPT-Live, una nuova classe di modelli vocali che per la prima volta ascoltano e parlano simultaneamente. L’architettura full-duplex riscrive le regole dell’interazione vocale con l’AI: niente più turni rigidi, interruzioni fuori luogo o risposte poco intelligenti, perché i compiti complessi vengono delegati in background a GPT-5.5. Il risultato è una conversazione più fluida, precisa e umana, disponibile da subito su ChatGPT per tutti gli utenti.
I precedenti sistemi vocali di ChatGPT si basavano su un approccio a turni: l’utente parlava, il modello elaborava, rispondeva. Con GPT-Live, il modello elabora input e genera output in continuo, decidendo più volte al secondo se parlare, restare in ascolto, interrompersi o invocare uno strumento.
«Questo è un modello full duplex», ha spiegato Atty Eleti, product lead di ChatGPT Voice. «Significa che può parlare e ascoltare allo stesso tempo. Dal lato del modello, può processare il flusso di input e produrre il flusso di output in modo continuo e simultaneo». L’effetto immediato è una conversazione dove gli interlocutori possono sovrapporsi, interrompersi o inserire pause senza che il flusso si blocchi.
Il vero salto di qualità sta nell’architettura a due livelli. GPT-Live gestisce l’interazione continua, ma quando la domanda richiede ricerca web, ragionamento complesso o capacità agentiche, il compito viene passato in background a GPT-5.5. Intanto la conversazione prosegue, e il risultato viene riportato appena pronto.
I numeri mostrano l’impatto di questa scelta. Su GPQA, test di ragionamento scientifico di livello esperto, GPT-Live-1 con ragionamento “High” raggiunge l’84,2% di accuratezza, contro il 45,3% della precedente Advanced Voice Mode. Il divario è ancora più netto su BrowseComp, benchmark di ricerca web agentica: GPT-Live-1 tocca il 75,2%, Advanced Voice Mode si ferma a uno 0,7% praticamente inutilizzabile. Anche la versione Mini, destinata agli account gratuiti, sale al 31,6%.
| Benchmark | GPT-Live-1 (High) | Advanced Voice Mode | GPT-Live-1 mini |
|---|---|---|---|
| GPQA (ragionamento scientifico) | 84,2% | 45,3% | – |
| BrowseComp (ricerca web agentica) | 75,2% | 0,7% | 31,6% |
| tau3 Voice Telecom (task di supporto) | ~65% (385s) | ~30% (tempo simile) | 37% (225s, Instant) |
Sul benchmark tau3 Voice Telecom, che simula compiti realistici di assistenza clienti, GPT-Live-1 (High) completa circa il 65% dei task in 385 secondi, mentre Advanced Voice Mode non supera il 30%. La versione Instant dello stesso modello, pensata per risposte rapide, risolve il 37% dei compiti in soli 225 secondi.

GPT-Live introduce miglioramenti immediatamente percepibili. Il modello ora aspetta che l’utente finisca di parlare anche dopo una pausa, invece di scambiarla per la fine del turno. Può restare in silenzio e ascoltare finché non viene chiamato in causa, e usa parole di riempimento come “mhmm” o “capito” per segnalare che sta seguendo il discorso.
Durante la conversazione, ChatGPT può mostrare schede visive con dati su meteo, borsa o sport. La traduzione in tempo reale è un’altra novità diretta dell’architettura full-duplex: il modello traduce mentre l’utente parla, senza attendere la fine della frase. L’esperienza, tuttavia, non è ancora perfetta: nella demo di traduzione in hindi mostrata alla stampa, l’assistente aveva un marcato accento americano e un tono da libro di testo, un dettaglio che OpenAI non ha nascosto e che probabilmente verrà affinato.
Le preferenze degli utenti confermano il salto qualitativo. In test comparativi con conversazioni di 5–10 minuti, il 75,7% dei partecipanti ha preferito GPT-Live-1 ad Advanced Voice Mode, percentuale che scende al 69,2% per la versione Mini.
Una voce più naturale amplifica anche i rischi di dipendenza emotiva, un fenomeno già documentato tra gli utenti assidui dei modelli vocali. OpenAI ha inserito sistemi di sicurezza in tempo reale che possono correggere risposte potenzialmente dannose, mostrare avvisi o interrompere la conversazione nei casi più critici. Per i minorenni, il modello è addestrato a comportamenti adeguati all’età e i genitori possono controllare l’accesso tramite parental control.
Il modello usa esclusivamente voci predefinite e non può imitare persone reali. Resta il fatto che la crescente umanizzazione dell’interazione vocale solleva interrogativi profondi, mentre OpenAI è già alle prese con cause legali che chiamano in causa l’impatto psicologico dei suoi strumenti.
GPT-Live non è un semplice aggiornamento cosmetico. È il primo modello vocale a ereditare in tempo reale l’intelligenza dei modelli testuali di punta, e i benchmark lo dimostrano: BrowseComp passa da 0,7% a 75,2%, un miglioramento di oltre cento volte. «Con il tempo, crediamo che questo sbloccherà la possibilità di usare la voce come interfaccia primaria per il computing, e per gestire lavoro agentico sempre più complesso e prolungato», ha dichiarato Eleti. L’orizzonte è quello di un’AI che non solo risponde, ma agisce mentre conversa. Restano da monitorare la qualità multilingue e la tenuta psicologica di un’interazione così ravvicinata.