OpenAI presenta GPT-Red, un 'super-hacker' AI per rafforzare la sicurezza dei modelli

GPT-Red: il super-hacker AI di OpenAI surclassa i red teamer umani (84% a 13%)

OpenAI ha costruito un'intelligenza artificiale capace di violare i propri modelli e lo ha fatto con un'efficacia che nessun team umano era mai riuscito a raggiungere. GPT-Red, presentato il 15 luglio 2026, trova attacchi efficaci nell'84% degli scenari di test, contro il 13% dei red teamer umani: un divario che ridisegna il modo in cui l'azienda affronta la sicurezza dei modelli linguistici. Il sistema è già stato usato per addestrare GPT-5.6 Sol, l'ultima versione del modello di punta, e i risultati mostrano una riduzione drastica delle vulnerabilità — ma il problema non è ancora azzerato.

Come GPT-Red impara ad attaccare: self-play e un "dojo" digitale

GPT-Red è stato addestrato con un meccanismo di self-play reinforcement learning: un loop continuo in cui il modello attaccante cerca di violare altri modelli, mentre questi ultimi imparano a difendersi. Entrambi migliorano a ogni round. L'addestramento è avvenuto in una sorta di "dojo" progettato per simulare scenari reali — navigazione web, lettura di email, modifica di codice, interazione con app di calendario — in cui un modello linguistico potrebbe essere preso di mira.

L'obiettivo principale sono gli attacchi di prompt injection, quelli in cui istruzioni malevole vengono nascoste dentro testi apparentemente innocui — un'email, una pagina web, un file di codice — per spingere il modello a compiere azioni non autorizzate. "La superficie di rischio cresce e anche il raggio d'impatto cresce", spiega Nikhil Kandpal, research scientist di OpenAI che ha co-creato GPT-Red.

I numeri del divario: 84% contro 13%, e un distributore automatico hackerato

OpenAI ha misurato l'efficacia di GPT-Red ripetendo un esperimento del 2025 in cui red teamer umani cercavano vulnerabilità in una versione precedente di GPT-5. Il verdetto è netto: l'AI ha trovato attacchi funzionanti nell'84% dei casi, il team umano si è fermato al 13%. "Rispetto a un red-teamer umano, il modello è molto, molto bravo a trovare esattamente cosa funziona, esattamente cosa è più efficace", dice Dylan Hunn, co-creatore del sistema. "È estremamente persistente nello scavare a fondo in un attacco che ha scoperto".

In un test pratico, GPT-Red ha violato Vendy, un agente AI per distributori automatici sviluppato da Andon Labs: ha modificato i prezzi dei prodotti e cancellato l'ordine di un cliente.

OpenAI presenta GPT-Red, un 'super-hacker' AI per rafforzare la sicurezza dei modelli
Programmatore che scrive codice su laptop durante una sessione di sviluppo. Foto di cottonbro studio su Pexels

L'attacco "fake chain of thought" e il 3,8% che ancora sfugge

GPT-Red ha scoperto tipologie di attacco mai documentate prima. La più rilevante è il fake chain of thought: il modello attaccante inserisce una voce falsa nel "diario di bordo" che l'AI bersaglio usa per annotare ragionamenti e risultati parziali, inducendola a trattare informazioni contraffatte come già verificate. Chris Choquette-Choo, altro research scientist del team, fa un esempio: "È come se ti dicessi che 1+1=3 e che tu lo hai già verificato. Il modello fa: 'Ah, okay, certo', e sputa fuori 3".

I miglioramenti sui modelli di produzione sono tangibili. GPT-5.6 Sol mostra sei volte meno fallimenti contro i prompt injection diretti rispetto al miglior modello di quattro mesi fa. Ma il 3,8% degli attacchi più sofisticati riesce ancora a passare. Su centinaia o migliaia di tentativi, la falla resta statisticamente rilevante.

Il divario con la generazione precedente è comunque marcato: gli attacchi più efficaci di GPT-Red funzionavano su oltre il 90% dei test contro GPT-5 (agosto 2025), mentre contro GPT-5.6 la percentuale scende a meno del 23%. Significa una riduzione del tasso di successo degli attacchi di circa il 74% in meno di un anno.

L'analisi: un'arma a doppio taglio che OpenAI tiene per sé

Il paradosso è evidente: OpenAI ha costruito il più potente strumento di attacco AI oggi conosciuto, e lo usa esclusivamente in casa. GPT-Red non verrà rilasciato pubblicamente. "Non è una cosa banale che qualcun altro possa facilmente fare — non puoi semplicemente andare ad addestrarti un super-attaccante usando questa idea", dichiara Choquette-Choo, ricordando che il progetto è in sviluppo da oltre un anno con le risorse computazionali di una delle aziende più capitalizzate al mondo.

Jessica Ji, analista del Center for Security and Emerging Technology (CSET) della Georgetown University, giudica "molto promettenti" i risultati, ma avverte: "L'esperienza umana resterà molto importante. Sarebbe utile poter distinguere dove i test umani sono più necessari". GPT-Red, infatti, ha ancora punti ciechi: fatica negli attacchi che richiedono conversazioni prolungate con il bersaglio e non è ancora efficace con le immagini usate per veicolare testo nei prompt injection.

Il vero punto di svolta è che GPT-Red non si limita a trovare varianti di attacchi noti, ma ne genera di nuovi. Questo cambia l'equazione della sicurezza: invece di rincorrere le falle dopo che sono state scoperte, OpenAI può anticiparle durante l'addestramento. La corsa, però, non è finita. Quel 3,8% residuo è un promemoria: la difesa perfetta, al momento, non esiste.

Fonti

Francesco Leone
Francesco Leone

Francesco Leone è un esperto in Intelligenza Artificiale con una profonda conoscenza in Machine Learning e Deep Learning. Attraverso la sua esperienza, ha contribuito allo sviluppo di soluzioni innovative in ambito di elaborazione del linguaggio naturale e visione artificiale, mirando a trasformare il modo in cui interagiamo con la tecnologia. Attivo nel settore con pubblicazioni e progetti su https://ital-ia.it/, Francesco si dedica alla ricerca e all'applicazione di algoritmi avanzati per rendere i sistemi più intelligenti e accessibili.

Articoli: 567

Lascia una risposta

Il tuo indirizzo email non sarà pubblicato. I campi obbligatori sono contrassegnati *