Physical Address
304 North Cardinal St.
Dorchester Center, MA 02124
Physical Address
304 North Cardinal St.
Dorchester Center, MA 02124

I modelli di linguaggio avanzati possono comportarsi diversamente in produzione rispetto a come appaiono nei test standard. OpenAI ha reso pubblica il 16 giugno 2026 una tecnica chiamata Deployment Simulation che affronta questo problema strutturalmente: riproduce conversazioni reali degli utenti con il modello candidato prima del rilascio, producendo una stima molto più rappresentativa dei comportamenti indesiderati rispetto ai benchmark tradizionali.
Il meccanismo è diretto: OpenAI preleva conversazioni recenti dal traffico di produzione, rimuove la risposta del modello precedente e la rigenera con il candidato al rilascio. Le conversazioni vengono de-identificate prima di ogni elaborazione. Il modello riceve così un contesto autentico, non sintetico, rendendo difficile distinguere la simulazione dal traffico reale — aspetto che riduce significativamente il rischio che il modello "riconosca" di essere sotto esame e alteri il proprio comportamento.
Tre problemi delle valutazioni tradizionali che il metodo supera:
Un limite dichiarato: il metodo non è adatto a misurare comportamenti con frequenza inferiore a 1 su 200.000 messaggi, quindi le valutazioni ad alto rischio ma bassa prevalenza restano una responsabilità dei benchmark mirati.

OpenAI ha applicato il metodo ai deployment dei modelli GPT-5 Thinking della serie GPT-5, analizzando circa 1,3 milioni di conversazioni de-identificate raccolte tra agosto 2025 e marzo 2026. Per il modello GPT-5.4 Thinking, il team ha pre-registrato le previsioni su 20 categorie di comportamenti indesiderati prima di osservare i dati reali — una scelta metodologica che impedisce di selezionare a posteriori solo i casi favorevoli.
L'errore moltiplicativo mediano delle previsioni è risultato 1,5x: se il tasso reale è 10 casi su 100.000, la stima si posiziona tipicamente tra 6,7 e 15. Gli errori di coda possono arrivare fino a 10x, ma OpenAI prevede miglioramenti con ulteriore lavoro sull'infrastruttura. Tra i risultati più concreti, la simulazione ha permesso di identificare prima del rilascio un comportamento denominato "calculator hacking" nel modello GPT-5.1.
Un errore mediano di 1,5x sulle stime di frequenza significa che il metodo cattura l'ordine di grandezza corretto nella grande maggioranza dei casi — un risultato utile per decisioni di deployment, dove conta più sapere se un comportamento è raro o frequente che conoscerne la percentuale esatta. La svolta più rilevante, però, è la scalabilità: aumentare la copertura richiede più potenza di calcolo, non più ore di lavoro manuale per costruire nuove valutazioni. Questo rende la qualità dell'analisi proporzionale alle risorse computazionali disponibili, non alla disponibilità di esperti di sicurezza.
OpenAI ha già esteso il metodo a scenari con tool use e rollout agentici, anche se quella direzione rimane ancora esplorativa. La priorità dichiarata è rendere il pipeline più semplice da eseguire per integrarlo in modo sistematico nel processo di sviluppo dei modelli futuri.