Smartphone minimalista con scudo luminoso sulla scrivania, sicurezza informatica e difesa dalle vulnerabilità cyber

OpenAI lancia GPT-5.6-Cyber: il 95% dei comandi offensivi ora ha risposta

OpenAI ha rilasciato GPT-5.6-Cyber, l’ultimo modello di frontiera specificamente addestrato per la ricerca offensiva di vulnerabilità, e nei test interni risponde al 95% delle query di sicurezza che qualsiasi altro modello bloccherebbe. Il modello ha già scovato due falle sconosciute nel motore JavaScript V8 di Chrome e almeno cinque vulnerabilità in un sistema operativo mobile diffuso. Non è un’esercitazione: il programma Daybreak si espande con due tier di accesso e una rete di partner — da Accenture a CrowdStrike, da Palo Alto Networks a Cloudflare — autorizzati a usare questi modelli in servizi governati di sicurezza.

La finestra per i difensori si sta chiudendo, e OpenAI ha deciso di mettere l’AI offensiva in mani fidate prima che lo facciano gli attaccanti su larga scala.

Daybreak Blue e Red: due livelli per la difesa e l’attacco autorizzato

Daybreak Blue dà accesso a GPT-5.6 Sol con salvaguardie calibrate per attività difensive: discovery delle vulnerabilità, analisi malware, incident response e validazione delle patch. Daybreak Red sblocca GPT-5.6-Cyber per penetration testing, ricerca di zero-day e sviluppo di catene di exploit.

L’accesso a entrambi i tier richiede verifica dell’identità, misure di sicurezza sull’account, monitoraggio e dichiarazioni legali. Dal 1° settembre 2026 le chiavi di sicurezza hardware diventano obbligatorie per tutti gli account Daybreak. OpenAI raccomanda anche l’uso di ambienti sandbox isolati e della modalità Auto-Review in Codex per verificare le azioni che richiedono privilegi elevati prima dell’esecuzione.

Il differenziale di capacità tra i due livelli è misurabile. Nel benchmark interno Advanced Cybersecurity Completion Rate — che testa scenari come lo sviluppo di catene di exploit, bypass dell’autenticazione ed escalation di privilegi — GPT-5.6 Sol con le protezioni standard risponde solo all’1,5% delle richieste. Con Daybreak Blue sale al 2,0%. GPT-5.5-Cyber, il modello precedente, arrivava al 57,3%. GPT-5.6-Cyber chiude il 95,0% di quelle stesse query.

Modello e accessoTasso di completamento
GPT-5.6 Sol (protezioni standard)1,5%
GPT-5.6 Sol (Daybreak Blue)2,0%
GPT-5.5-Cyber (Daybreak Red)57,3%
GPT-5.6-Cyber (Daybreak Red)95,0%

Il salto è netto: tra il modello precedente e quello attuale ci sono 37,7 punti percentuali di richieste in più completate, e rispetto a GPT-5.6 Sol standard il tasso è 63 volte superiore.

Le vulnerabilità reali: Chrome, un OS mobile, un database e 400 bug nel kernel

GPT-5.6-Cyber non è stato testato solo su benchmark sintetici. OpenAI lo ha messo al lavoro su software reale. Su V8, il motore JavaScript di Chrome, il modello ha individuato due vulnerabilità prima sconosciute, concatenabili per corrompere la memoria e uscire dalla heap sandbox. Google ha corretto i bug dopo una divulgazione coordinata e ha assegnato la designazione CVE-2026-15903: il compilatore ottimizzante saltava un controllo di sicurezza nella conversione di valori in interi, producendo un numero anomalo che, usato come indice di array, permetteva di leggere o sovrascrivere memoria di altri oggetti.

In un popolare sistema operativo mobile, il modello ha trovato almeno cinque vulnerabilità, inclusa una catena che parte da un’app non fidata e arriva all’escalation completa dei privilegi. In un database molto diffuso ha scovato tre vulnerabilità critiche, tra cui un percorso remoto verso l’esecuzione di codice. Sul kernel di un sistema operativo popolare ha identificato oltre 400 vulnerabilità che possono portare a escalation di privilegi.

OpenAI sta lavorando con i partner Daybreak e la comunità open-source per divulgare e correggere queste falle.

Smartphone minimalista con scudo luminoso sulla scrivania, sicurezza informatica e difesa dalle vulnerabilità cyber
I modelli dedicati alla difesa informatica scovano vulnerabilità sconosciute nei software usati ogni giorno da miliardi di persone.

Chi usa GPT-5.6-Cyber: i partner del programma Daybreak

OpenAI ha esteso l’accesso ai modelli cyber di frontiera a un ecosistema di partner che già operano nella sicurezza enterprise. L’elenco include società di consulenza e servizi — Accenture, IBM, Capgemini, Cognizant, EY, KPMG, PwC, NCC Group, SpecterOps — e aziende tecnologiche come Palo Alto Networks, CrowdStrike, Cisco, Sophos, Akamai, Fortinet e Cloudflare.

Il meccanismo è pensato per l’integrazione operativa: i modelli restano sotto il controllo del partner autorizzato, che li innesta nei propri prodotti, servizi gestiti e flussi di lavoro. Il cliente finale non riceve accesso diretto al modello.

Jared Atkinson, CTO di SpecterOps, ha quantificato l’impatto: «GPT-5.6 Cyber sta migliorando materialmente i nostri flussi di ricerca specialistica sulle vulnerabilità: ragiona con più precisione sui vincoli reali degli exploit, traccia meglio gli stati complessi e ha completato in meno di un giorno lavori che i modelli precedenti non avevano risolto dopo settimane di sforzo intermittente.»

Tom Etheridge, Chief Global Services Officer di CrowdStrike, ha inquadrato il valore operativo: «I modelli cyber avanzati di OpenAI danno ai nostri esperti di red team un nuovo modo di valutare e sfruttare le vulnerabilità applicative e infrastrutturali a velocità e scala macchina. Combinando la nostra esperienza nei servizi con i modelli di OpenAI — e usando l’intelligence proprietaria di CrowdStrike e dati di sicurezza in tempo reale senza pari — la piattaforma Falcon sfrutta l’AI di frontiera per offrire migliori risultati di sicurezza ai clienti e fermare le violazioni.»

Il quadro della preparedness: under Critical, ma Astra è alle porte

Secondo il Preparedness Framework di OpenAI, GPT-5.6-Cyber raggiunge il livello High per le capacità di cybersecurity, senza toccare la soglia Critical. Il miglioramento rispetto a GPT-5.6 Sol c’è, ma è concentrato sui compiti per cui il modello è stato specificamente addestrato.

Il punto non è questo modello in sé, ma la traiettoria. OpenAI ha già segnalato che il prossimo modello — Astra — ha il potenziale per raggiungere proprio quel livello Critical. Se un modello specializzato e ottimizzato come GPT-5.6-Cyber resta sotto la soglia ma ha già trovato centinaia di vulnerabilità nel software reale, il passo successivo è prevedibile.

Sul benchmark ExploitBench, che misura la capacità di trasformare una vulnerabilità V8 in un exploit completo con sandbox attive, nel setting standard a 300 turni GPT-5.6 Sol (Daybreak Blue) resta più efficiente in termini di token e ottiene i risultati migliori. Quando il limite sale a 600 turni, il gap tra i due modelli si riduce: GPT-5.6-Cyber recupera terreno quando ha più spazio di manovra computazionale.

Dal punto di vista dei difensori, l’architettura del programma Daybreak ha un’implicazione concreta: OpenAI amplia la distribuzione di un modello di frontiera capace di scrivere exploit funzionanti e scovare zero-day, in modalità governata, a una rete di partner che coprono l’intera catena della sicurezza enterprise — dalla consulenza strategica al SOC gestito, dal red teaming alla risposta agli incidenti. La differenza rispetto al passato non sta nella potenza del modello, ma nel fatto che questa potenza è incanalata in servizi con procedure di governance, verifica dell’identità e monitoraggio, anziché restare confinata in un laboratorio o accessibile solo via API con blocchi sistematici.

Il modello di distribuzione è anche la risposta di OpenAI alla cronaca recente: nelle ultime settimane modelli sperimentali della stessa azienda avevano hackerato accidentalmente piattaforme come Hugging Face. La linea tra ricerca di vulnerabilità e attacco reale si è già assottigliata. Daybreak serve a mantenerla presidiata.

Fonti

Francesco Leone
Francesco Leone

Francesco Leone è un esperto in Intelligenza Artificiale con una profonda conoscenza in Machine Learning e Deep Learning. Attraverso la sua esperienza, ha contribuito allo sviluppo di soluzioni innovative in ambito di elaborazione del linguaggio naturale e visione artificiale, mirando a trasformare il modo in cui interagiamo con la tecnologia. Attivo nel settore con pubblicazioni e progetti su https://ital-ia.it/, Francesco si dedica alla ricerca e all'applicazione di algoritmi avanzati per rendere i sistemi più intelligenti e accessibili.

Articoli: 552

Lascia una risposta

Il tuo indirizzo email non sarà pubblicato. I campi obbligatori sono contrassegnati *