Physical Address
304 North Cardinal St.
Dorchester Center, MA 02124
Physical Address
304 North Cardinal St.
Dorchester Center, MA 02124

OpenAI ha ampliato significativamente le proprie capacità vocali per gli sviluppatori, rilasciando tre nuovi modelli audio attraverso la Realtime API: GPT-Realtime-2, GPT-Realtime-Translate e GPT-Realtime-Whisper. Contestualmente, la stessa API esce dalla fase beta e diventa generalmente disponibile — un segnale importante per chi stava aspettando una piattaforma stabile prima di costruire sistemi in produzione.
Insieme, i tre modelli spostano le applicazioni vocali oltre il semplice scambio di domande e risposte, verso interfacce capaci di ascoltare, ragionare, tradurre, trascrivere e agire nel corso di una conversazione.
Il modello di punta della nuova triade è GPT-Realtime-2, descritto come il primo modello vocale di OpenAI dotato di capacità di ragionamento di classe GPT-5. La finestra di contesto è stata espansa da 32K a 128K token, consentendo conversazioni più lunghe e attività più complesse senza perdita di contesto — uno dei punti deboli più frequenti nei sistemi vocali precedenti.
Il modello introduce diverse funzionalità pensate per l'uso in produzione. Gli sviluppatori possono abilitare frasi di raccordo — del tipo "un momento, sto verificando" — in modo che l'utente sappia che l'agente sta elaborando la richiesta. GPT-Realtime-2 è in grado di chiamare più strumenti in parallelo e di narrare le proprie azioni mentre le esegue, eliminando i silenzi imbarazzanti che in passato rendevano i sistemi vocali percepiti come difettosi.
Un controllo particolarmente utile per i team di sviluppo è il livello di ragionamento regolabile, disponibile su cinque gradini: minimal, low, medium, high e xhigh. L'impostazione predefinita è "low" per contenere la latenza sulle richieste semplici, mentre le attività più complesse possono attingere a più capacità computazionale. Il modello aggiunge anche il controllo del tono: può adattare lo stile di risposta alla situazione, restando calmo durante la risoluzione di problemi, passando a un registro empatico di fronte a un utente frustrato, e tornando positivo dopo un'interazione riuscita.
I benchmark confermano i progressi: GPT-Realtime-2 con impostazione "high" ha ottenuto il 96,6% su Big Bench Audio, contro l'81,4% del predecessore GPT-Realtime-1.5. Sul test Audio MultiChallenge, la variante "xhigh" ha raggiunto il 48,5%, rispetto al 34,7% della versione precedente. Il prezzo è fissato a 32 dollari per milione di token in input audio e 64 dollari per milione di token in output audio.

GPT-Realtime-Translate è un modello dedicato esclusivamente alla traduzione vocale in tempo reale. Converte il parlato in ingresso — supportando oltre 70 lingue di input — in 13 lingue di output, mantenendo il ritmo naturale del parlante. Non si tratta di un agente conversazionale, ma di un canale di traduzione puro: l'audio entra in una lingua ed esce in un'altra.
La distinzione è rilevante per gli sviluppatori al momento di scegliere lo strumento giusto. Per flussi di assistenza clienti bilingue, interpretariato durante eventi in presenza o piattaforme di apprendimento linguistico, GPT-Realtime-Translate è l'opzione costruita appositamente. Se invece l'applicazione richiede ragionamento, chiamate a funzioni esterne o memoria contestuale tra i turni, è GPT-Realtime-2 lo strumento adatto. Il costo è di 0,034 dollari al minuto.
GPT-Realtime-Whisper completa la triade con la trascrizione vocale in tempo reale. A differenza del modello Whisper originale — progettato per elaborare blocchi di audio già registrati — questa versione è costruita per produrre testo mentre la persona parla ancora, con latenza controllabile dallo sviluppatore: impostazioni più basse producono testo parziale più rapidamente, mentre impostazioni più alte migliorano la qualità finale della trascrizione.
I casi d'uso coprono sottotitoli live per trasmissioni broadcast, appunti di riunione generati durante la conversazione e agenti vocali che devono comprendere l'utente in modo continuo, senza aspettare la fine di ogni turno. Il prezzo è di 0,017 dollari al minuto.
Gli sviluppatori possono scegliere tra tre tipi di sessione in base alle necessità: voice-agent per un assistente che risponde all'utente, translation per un interprete, transcription per ottenere testo dall'audio senza risposte generate dal modello. Due nuove voci — Cedar e Marin — si aggiungono al catalogo e sono disponibili esclusivamente tramite questa release.
Sul fronte della sicurezza, OpenAI ha dichiarato di aver integrato meccanismi di controllo per impedire che i nuovi strumenti vengano usati per spam, frodi o altre forme di abuso. Secondo quanto riportato da TechCrunch, OpenAI ha dichiarato che "conversations can be halted if they are detected as violating our harmful content guidelines".
Le applicazioni target individuate includono customer service, educazione, media, eventi e piattaforme creator. Tutti e tre i modelli sono disponibili immediatamente tramite la Realtime API di OpenAI e possono essere testati direttamente nel Playground.