Conversazione vocale AI full-duplex rappresentata da onde sonore sovrapposte sopra uno smartphone su superficie chiara

GPT-Live: la nuova voce OpenAI ascolta e parla insieme, delegando a GPT-5.5

OpenAI ha rilasciato oggi GPT-Live, una nuova classe di modelli vocali che per la prima volta ascoltano e parlano simultaneamente. L’architettura full-duplex riscrive le regole dell’interazione vocale con l’AI: niente più turni rigidi, interruzioni fuori luogo o risposte poco intelligenti, perché i compiti complessi vengono delegati in background a GPT-5.5. Il risultato è una conversazione più fluida, precisa e umana, disponibile da subito su ChatGPT per tutti gli utenti.

Architettura full-duplex: addio ai turni forzati

I precedenti sistemi vocali di ChatGPT si basavano su un approccio a turni: l’utente parlava, il modello elaborava, rispondeva. Con GPT-Live, il modello elabora input e genera output in continuo, decidendo più volte al secondo se parlare, restare in ascolto, interrompersi o invocare uno strumento.

«Questo è un modello full duplex», ha spiegato Atty Eleti, product lead di ChatGPT Voice. «Significa che può parlare e ascoltare allo stesso tempo. Dal lato del modello, può processare il flusso di input e produrre il flusso di output in modo continuo e simultaneo». L’effetto immediato è una conversazione dove gli interlocutori possono sovrapporsi, interrompersi o inserire pause senza che il flusso si blocchi.

Delega a GPT-5.5: il salto nei benchmark

Il vero salto di qualità sta nell’architettura a due livelli. GPT-Live gestisce l’interazione continua, ma quando la domanda richiede ricerca web, ragionamento complesso o capacità agentiche, il compito viene passato in background a GPT-5.5. Intanto la conversazione prosegue, e il risultato viene riportato appena pronto.

I numeri mostrano l’impatto di questa scelta. Su GPQA, test di ragionamento scientifico di livello esperto, GPT-Live-1 con ragionamento “High” raggiunge l’84,2% di accuratezza, contro il 45,3% della precedente Advanced Voice Mode. Il divario è ancora più netto su BrowseComp, benchmark di ricerca web agentica: GPT-Live-1 tocca il 75,2%, Advanced Voice Mode si ferma a uno 0,7% praticamente inutilizzabile. Anche la versione Mini, destinata agli account gratuiti, sale al 31,6%.

BenchmarkGPT-Live-1 (High)Advanced Voice ModeGPT-Live-1 mini
GPQA (ragionamento scientifico)84,2%45,3%
BrowseComp (ricerca web agentica)75,2%0,7%31,6%
tau3 Voice Telecom (task di supporto)~65% (385s)~30% (tempo simile)37% (225s, Instant)

Sul benchmark tau3 Voice Telecom, che simula compiti realistici di assistenza clienti, GPT-Live-1 (High) completa circa il 65% dei task in 385 secondi, mentre Advanced Voice Mode non supera il 30%. La versione Instant dello stesso modello, pensata per risposte rapide, risolve il 37% dei compiti in soli 225 secondi.

Conversazione vocale AI full-duplex rappresentata da onde sonore sovrapposte sopra uno smartphone su superficie chiara
Con GPT-Live i modelli vocali ascoltano e parlano simultaneamente per conversazioni più fluide e naturali.

Meno interruzioni, più contesto: come funziona nella pratica

GPT-Live introduce miglioramenti immediatamente percepibili. Il modello ora aspetta che l’utente finisca di parlare anche dopo una pausa, invece di scambiarla per la fine del turno. Può restare in silenzio e ascoltare finché non viene chiamato in causa, e usa parole di riempimento come “mhmm” o “capito” per segnalare che sta seguendo il discorso.

Durante la conversazione, ChatGPT può mostrare schede visive con dati su meteo, borsa o sport. La traduzione in tempo reale è un’altra novità diretta dell’architettura full-duplex: il modello traduce mentre l’utente parla, senza attendere la fine della frase. L’esperienza, tuttavia, non è ancora perfetta: nella demo di traduzione in hindi mostrata alla stampa, l’assistente aveva un marcato accento americano e un tono da libro di testo, un dettaglio che OpenAI non ha nascosto e che probabilmente verrà affinato.

Le preferenze degli utenti confermano il salto qualitativo. In test comparativi con conversazioni di 5–10 minuti, il 75,7% dei partecipanti ha preferito GPT-Live-1 ad Advanced Voice Mode, percentuale che scende al 69,2% per la versione Mini.

Sicurezza e rischi: il lato oscuro dell’empatia vocale

Una voce più naturale amplifica anche i rischi di dipendenza emotiva, un fenomeno già documentato tra gli utenti assidui dei modelli vocali. OpenAI ha inserito sistemi di sicurezza in tempo reale che possono correggere risposte potenzialmente dannose, mostrare avvisi o interrompere la conversazione nei casi più critici. Per i minorenni, il modello è addestrato a comportamenti adeguati all’età e i genitori possono controllare l’accesso tramite parental control.

Il modello usa esclusivamente voci predefinite e non può imitare persone reali. Resta il fatto che la crescente umanizzazione dell’interazione vocale solleva interrogativi profondi, mentre OpenAI è già alle prese con cause legali che chiamano in causa l’impatto psicologico dei suoi strumenti.

Una voce che pensa: la fine del divario tra canali

GPT-Live non è un semplice aggiornamento cosmetico. È il primo modello vocale a ereditare in tempo reale l’intelligenza dei modelli testuali di punta, e i benchmark lo dimostrano: BrowseComp passa da 0,7% a 75,2%, un miglioramento di oltre cento volte. «Con il tempo, crediamo che questo sbloccherà la possibilità di usare la voce come interfaccia primaria per il computing, e per gestire lavoro agentico sempre più complesso e prolungato», ha dichiarato Eleti. L’orizzonte è quello di un’AI che non solo risponde, ma agisce mentre conversa. Restano da monitorare la qualità multilingue e la tenuta psicologica di un’interazione così ravvicinata.

Fonti

Francesco Leone
Francesco Leone

Francesco Leone è un esperto in Intelligenza Artificiale con una profonda conoscenza in Machine Learning e Deep Learning. Attraverso la sua esperienza, ha contribuito allo sviluppo di soluzioni innovative in ambito di elaborazione del linguaggio naturale e visione artificiale, mirando a trasformare il modo in cui interagiamo con la tecnologia. Attivo nel settore con pubblicazioni e progetti su https://ital-ia.it/, Francesco si dedica alla ricerca e all'applicazione di algoritmi avanzati per rendere i sistemi più intelligenti e accessibili.

Articoli: 562

Lascia una risposta

Il tuo indirizzo email non sarà pubblicato. I campi obbligatori sono contrassegnati *