Close-up of a golden microphone and laptop used for audio editing.

OpenAI lancia tre nuovi modelli audio nella Realtime API: voce, traduzione e trascrizione in tempo reale

OpenAI ha ampliato significativamente le proprie capacità vocali per gli sviluppatori, rilasciando tre nuovi modelli audio attraverso la Realtime API: GPT-Realtime-2, GPT-Realtime-Translate e GPT-Realtime-Whisper. Contestualmente, la stessa API esce dalla fase beta e diventa generalmente disponibile — un segnale importante per chi stava aspettando una piattaforma stabile prima di costruire sistemi in produzione.

Insieme, i tre modelli spostano le applicazioni vocali oltre il semplice scambio di domande e risposte, verso interfacce capaci di ascoltare, ragionare, tradurre, trascrivere e agire nel corso di una conversazione.

GPT-Realtime-2: ragionamento vocale con finestra da 128K token

Il modello di punta della nuova triade è GPT-Realtime-2, descritto come il primo modello vocale di OpenAI dotato di capacità di ragionamento di classe GPT-5. La finestra di contesto è stata espansa da 32K a 128K token, consentendo conversazioni più lunghe e attività più complesse senza perdita di contesto — uno dei punti deboli più frequenti nei sistemi vocali precedenti.

Il modello introduce diverse funzionalità pensate per l'uso in produzione. Gli sviluppatori possono abilitare frasi di raccordo — del tipo "un momento, sto verificando" — in modo che l'utente sappia che l'agente sta elaborando la richiesta. GPT-Realtime-2 è in grado di chiamare più strumenti in parallelo e di narrare le proprie azioni mentre le esegue, eliminando i silenzi imbarazzanti che in passato rendevano i sistemi vocali percepiti come difettosi.

Un controllo particolarmente utile per i team di sviluppo è il livello di ragionamento regolabile, disponibile su cinque gradini: minimal, low, medium, high e xhigh. L'impostazione predefinita è "low" per contenere la latenza sulle richieste semplici, mentre le attività più complesse possono attingere a più capacità computazionale. Il modello aggiunge anche il controllo del tono: può adattare lo stile di risposta alla situazione, restando calmo durante la risoluzione di problemi, passando a un registro empatico di fronte a un utente frustrato, e tornando positivo dopo un'interazione riuscita.

I benchmark confermano i progressi: GPT-Realtime-2 con impostazione "high" ha ottenuto il 96,6% su Big Bench Audio, contro l'81,4% del predecessore GPT-Realtime-1.5. Sul test Audio MultiChallenge, la variante "xhigh" ha raggiunto il 48,5%, rispetto al 34,7% della versione precedente. Il prezzo è fissato a 32 dollari per milione di token in input audio e 64 dollari per milione di token in output audio.

Close-up of a golden microphone and laptop used for audio editing.
Foto di Seej Nguyen su Pexels

GPT-Realtime-Translate: interpretariato simultaneo in 70+ lingue

GPT-Realtime-Translate è un modello dedicato esclusivamente alla traduzione vocale in tempo reale. Converte il parlato in ingresso — supportando oltre 70 lingue di input — in 13 lingue di output, mantenendo il ritmo naturale del parlante. Non si tratta di un agente conversazionale, ma di un canale di traduzione puro: l'audio entra in una lingua ed esce in un'altra.

La distinzione è rilevante per gli sviluppatori al momento di scegliere lo strumento giusto. Per flussi di assistenza clienti bilingue, interpretariato durante eventi in presenza o piattaforme di apprendimento linguistico, GPT-Realtime-Translate è l'opzione costruita appositamente. Se invece l'applicazione richiede ragionamento, chiamate a funzioni esterne o memoria contestuale tra i turni, è GPT-Realtime-2 lo strumento adatto. Il costo è di 0,034 dollari al minuto.

GPT-Realtime-Whisper: trascrizione in streaming a bassa latenza

GPT-Realtime-Whisper completa la triade con la trascrizione vocale in tempo reale. A differenza del modello Whisper originale — progettato per elaborare blocchi di audio già registrati — questa versione è costruita per produrre testo mentre la persona parla ancora, con latenza controllabile dallo sviluppatore: impostazioni più basse producono testo parziale più rapidamente, mentre impostazioni più alte migliorano la qualità finale della trascrizione.

I casi d'uso coprono sottotitoli live per trasmissioni broadcast, appunti di riunione generati durante la conversazione e agenti vocali che devono comprendere l'utente in modo continuo, senza aspettare la fine di ogni turno. Il prezzo è di 0,017 dollari al minuto.

Architettura, nuove voci e misure di sicurezza

Gli sviluppatori possono scegliere tra tre tipi di sessione in base alle necessità: voice-agent per un assistente che risponde all'utente, translation per un interprete, transcription per ottenere testo dall'audio senza risposte generate dal modello. Due nuove voci — Cedar e Marin — si aggiungono al catalogo e sono disponibili esclusivamente tramite questa release.

Sul fronte della sicurezza, OpenAI ha dichiarato di aver integrato meccanismi di controllo per impedire che i nuovi strumenti vengano usati per spam, frodi o altre forme di abuso. Secondo quanto riportato da TechCrunch, OpenAI ha dichiarato che "conversations can be halted if they are detected as violating our harmful content guidelines".

Le applicazioni target individuate includono customer service, educazione, media, eventi e piattaforme creator. Tutti e tre i modelli sono disponibili immediatamente tramite la Realtime API di OpenAI e possono essere testati direttamente nel Playground.

Francesco Leone
Francesco Leone

Francesco Leone è un esperto in Intelligenza Artificiale con una profonda conoscenza in Machine Learning e Deep Learning. Attraverso la sua esperienza, ha contribuito allo sviluppo di soluzioni innovative in ambito di elaborazione del linguaggio naturale e visione artificiale, mirando a trasformare il modo in cui interagiamo con la tecnologia. Attivo nel settore con pubblicazioni e progetti su https://ital-ia.it/, Francesco si dedica alla ricerca e all'applicazione di algoritmi avanzati per rendere i sistemi più intelligenti e accessibili.

Articoli: 553

Lascia una risposta

Il tuo indirizzo email non sarà pubblicato. I campi obbligatori sono contrassegnati *