Physical Address
304 North Cardinal St.
Dorchester Center, MA 02124
Physical Address
304 North Cardinal St.
Dorchester Center, MA 02124

GPT-5.5 Instant porta ChatGPT a superare le risposte scritte da medici in accuratezza, chiarezza e completezza: è il risultato dei benchmark interni di OpenAI pubblicati il 18 giugno 2026. Il modello è già disponibile per tutti gli utenti gratuiti e segna un progresso concreto in un'area in cui 230 milioni di persone si affidano a ChatGPT ogni settimana — dalla lettura dei referti alla preparazione delle visite mediche. Il miglioramento non è il frutto di un singolo aggiornamento, ma di un sistema di valutazione costruito su 700.000 risposte riviste da medici specialisti.
GPT-5.5 Instant è disponibile per gli utenti gratuiti da maggio 2026 e segna un salto rispetto al precedente GPT-5.3 Instant (marzo 2026) su aree specifiche delle risposte sanitarie:
I benchmark usati — HealthBench e HealthBench Professional — valutano le risposte su dimensioni come accuratezza, sicurezza, comunicazione, completezza e appropriate escalation. Su queste metriche, GPT-5.5 Instant raggiunge prestazioni paragonabili ai modelli Thinking di fascia alta, che hanno costi operativi significativamente superiori. Il punteggio dell'89,9% nella categoria instruction following posiziona il modello al di sopra sia di GPT-4o sia delle risposte scritte da medici in tutti e cinque i criteri di valutazione.
A confermare la tendenza c'è il traffico reale: con strumenti che preservano la privacy, OpenAI monitora miliardi di messaggi sanitari settimanali. La percentuale di risposte con almeno un problema di accuratezza fattuale è scesa del 71% negli ultimi due mesi, nell'arco aprile-giugno 2026.

Dietro al miglioramento c'è un'infrastruttura di valutazione medica permanente. OpenAI coordina una rete globale di oltre 260 medici in 60 paesi, con competenze in 26 specialità mediche e operativi in 49 lingue. Ogni pochi minuti un medico di questa rete esamina una risposta del modello; il feedback produce le rubric di valutazione che orientano lo sviluppo.
Per il confronto diretto con le risposte umane, OpenAI ha condotto uno studio su 3.500 casi: ha chiesto a medici di rispondere a conversazioni sanitarie rappresentative con tempo illimitato e accesso a internet, ma senza AI. Un panel separato di medici ha poi confrontato queste risposte con quelle del modello. GPT-5.5 Instant ha ottenuto valutazioni superiori su tutti i criteri: accuratezza, comunicazione, completezza, instruction following e utilità nelle decisioni di salute.
I medici valutatori hanno rilevato che il modello commette meno errori tipici rispetto sia ai modelli precedenti sia ai colleghi umani: adatta meglio la risposta al contesto sanitario locale, manca meno spesso i segnali d'allarme e chiede più frequentemente informazioni aggiuntive quando necessario.
Il calo del 71% è misurato su miliardi di messaggi reali, non su un dataset controllato, il che lo rende un indicatore di tendenza più robusto rispetto a un benchmark isolato. Il confronto diretto con i medici, tuttavia, va contestualizzato: i professionisti scrivevano senza accesso all'AI, in un setting che non replica una consultazione clinica. OpenAI non afferma che GPT-5.5 Instant sostituisca un medico — il modello è pensato per aiutare a orientarsi nel sistema sanitario, capire i referti e preparare le domande da fare al proprio medico.
Con 230 milioni di utenti settimanali, anche un miglioramento percentuale contenuto si traduce in decine di milioni di interazioni migliori ogni settimana — una scala senza equivalenti nella medicina tradizionale. La verifica più significativa arriverà però da valutazioni cliniche indipendenti: i benchmark di riferimento sono prodotti internamente da OpenAI, l'azienda che sviluppa il modello.