Physical Address
304 North Cardinal St.
Dorchester Center, MA 02124
Physical Address
304 North Cardinal St.
Dorchester Center, MA 02124

OpenAI ha costruito un'intelligenza artificiale capace di violare i propri modelli e lo ha fatto con un'efficacia che nessun team umano era mai riuscito a raggiungere. GPT-Red, presentato il 15 luglio 2026, trova attacchi efficaci nell'84% degli scenari di test, contro il 13% dei red teamer umani: un divario che ridisegna il modo in cui l'azienda affronta la sicurezza dei modelli linguistici. Il sistema è già stato usato per addestrare GPT-5.6 Sol, l'ultima versione del modello di punta, e i risultati mostrano una riduzione drastica delle vulnerabilità — ma il problema non è ancora azzerato.
GPT-Red è stato addestrato con un meccanismo di self-play reinforcement learning: un loop continuo in cui il modello attaccante cerca di violare altri modelli, mentre questi ultimi imparano a difendersi. Entrambi migliorano a ogni round. L'addestramento è avvenuto in una sorta di "dojo" progettato per simulare scenari reali — navigazione web, lettura di email, modifica di codice, interazione con app di calendario — in cui un modello linguistico potrebbe essere preso di mira.
L'obiettivo principale sono gli attacchi di prompt injection, quelli in cui istruzioni malevole vengono nascoste dentro testi apparentemente innocui — un'email, una pagina web, un file di codice — per spingere il modello a compiere azioni non autorizzate. "La superficie di rischio cresce e anche il raggio d'impatto cresce", spiega Nikhil Kandpal, research scientist di OpenAI che ha co-creato GPT-Red.
OpenAI ha misurato l'efficacia di GPT-Red ripetendo un esperimento del 2025 in cui red teamer umani cercavano vulnerabilità in una versione precedente di GPT-5. Il verdetto è netto: l'AI ha trovato attacchi funzionanti nell'84% dei casi, il team umano si è fermato al 13%. "Rispetto a un red-teamer umano, il modello è molto, molto bravo a trovare esattamente cosa funziona, esattamente cosa è più efficace", dice Dylan Hunn, co-creatore del sistema. "È estremamente persistente nello scavare a fondo in un attacco che ha scoperto".
In un test pratico, GPT-Red ha violato Vendy, un agente AI per distributori automatici sviluppato da Andon Labs: ha modificato i prezzi dei prodotti e cancellato l'ordine di un cliente.

GPT-Red ha scoperto tipologie di attacco mai documentate prima. La più rilevante è il fake chain of thought: il modello attaccante inserisce una voce falsa nel "diario di bordo" che l'AI bersaglio usa per annotare ragionamenti e risultati parziali, inducendola a trattare informazioni contraffatte come già verificate. Chris Choquette-Choo, altro research scientist del team, fa un esempio: "È come se ti dicessi che 1+1=3 e che tu lo hai già verificato. Il modello fa: 'Ah, okay, certo', e sputa fuori 3".
I miglioramenti sui modelli di produzione sono tangibili. GPT-5.6 Sol mostra sei volte meno fallimenti contro i prompt injection diretti rispetto al miglior modello di quattro mesi fa. Ma il 3,8% degli attacchi più sofisticati riesce ancora a passare. Su centinaia o migliaia di tentativi, la falla resta statisticamente rilevante.
Il divario con la generazione precedente è comunque marcato: gli attacchi più efficaci di GPT-Red funzionavano su oltre il 90% dei test contro GPT-5 (agosto 2025), mentre contro GPT-5.6 la percentuale scende a meno del 23%. Significa una riduzione del tasso di successo degli attacchi di circa il 74% in meno di un anno.
Il paradosso è evidente: OpenAI ha costruito il più potente strumento di attacco AI oggi conosciuto, e lo usa esclusivamente in casa. GPT-Red non verrà rilasciato pubblicamente. "Non è una cosa banale che qualcun altro possa facilmente fare — non puoi semplicemente andare ad addestrarti un super-attaccante usando questa idea", dichiara Choquette-Choo, ricordando che il progetto è in sviluppo da oltre un anno con le risorse computazionali di una delle aziende più capitalizzate al mondo.
Jessica Ji, analista del Center for Security and Emerging Technology (CSET) della Georgetown University, giudica "molto promettenti" i risultati, ma avverte: "L'esperienza umana resterà molto importante. Sarebbe utile poter distinguere dove i test umani sono più necessari". GPT-Red, infatti, ha ancora punti ciechi: fatica negli attacchi che richiedono conversazioni prolungate con il bersaglio e non è ancora efficace con le immagini usate per veicolare testo nei prompt injection.
Il vero punto di svolta è che GPT-Red non si limita a trovare varianti di attacchi noti, ma ne genera di nuovi. Questo cambia l'equazione della sicurezza: invece di rincorrere le falle dopo che sono state scoperte, OpenAI può anticiparle durante l'addestramento. La corsa, però, non è finita. Quel 3,8% residuo è un promemoria: la difesa perfetta, al momento, non esiste.