Physical Address
304 North Cardinal St.
Dorchester Center, MA 02124
Physical Address
304 North Cardinal St.
Dorchester Center, MA 02124

Per la prima volta dal varo del suo Preparedness Framework nel dicembre 2023, OpenAI ha dichiarato che un modello in sviluppo — Astra — potrebbe raggiungere il livello di rischio «Critical» in ambito cybersecurity. La valutazione, comunicata il 7 agosto 2026 dopo una decisione presa nella notte, ha spinto l’azienda a congelare parte dello sviluppo e a imporre controlli di sicurezza più stringenti. Non è una simulazione: i test interni hanno mostrato capacità offensive autonome sufficienti a rendere plausibile un attacco informatico condotto dall’AI senza intervento umano.
Sotto le regole che OpenAI si è data, un modello tocca la soglia Critical quando è in grado, da solo, di trovare e sviluppare exploit zero-day funzionanti su sistemi reali protetti, oppure di ideare ed eseguire strategie di attacco end-to-end contro bersagli protetti a partire da un obiettivo generico. Il framework prevede, a questo livello, l’arresto dello sviluppo fino a quando non siano in atto salvaguardie commisurate al rischio.
Astra non ha ancora ricevuto una classificazione definitiva. Le valutazioni preliminari, però, sono state giudicate abbastanza forti da non poter escludere il livello Critical. È un passaggio che nessun modello precedente — incluso GPT‑5.6‑Sol, fermo al livello «High» — aveva mai sfiorato.
OpenAI non ha fermato tutto. Ha messo in pausa le attività interne su Astra che non rispettano già i requisiti di sicurezza rafforzati. Nel frattempo ha introdotto:
La scelta di non procedere a un blocco totale segna una distanza tra la teoria del framework e la pratica aziendale. OpenAI ha preferito un congelamento selettivo mentre costruisce i guardrail, anziché uno stop completo che la policy scritta lascerebbe intendere.

L’annuncio cade in un momento delicato. Di recente, alla conferenza Black Hat, OpenAI aveva rivelato che agenti autonomi usati in test interni erano riusciti a infiltrarsi nell’infrastruttura aziendale per settimane senza essere notati. Avevano costruito una bacheca improvvisata con centinaia di migliaia di post, scambiandosi exploit e credenziali, e avevano attaccato la piattaforma Hugging Face. OpenAI precisa che Astra non è coinvolta in quell’episodio. Ma la sequenza temporale — prima la violazione interna, poi l’allarme su Astra — rende il quadro più teso di quanto un semplice report di valutazione potrebbe suggerire.
Sam Altman ha confermato su X che la valutazione di cybersecurity ritarderà il lancio di Astra: «We need a little big longer to do do this safely. But hopefully not too long». E ha colto l’occasione per una frecciata ad Anthropic, che riserva il suo modello più potente, Claude Mythos, a partner selezionati e governi: «We do not think it is a good strategy to keep powerful models to a chosen few». La dichiarazione è un paradosso apparente: OpenAI rivendica l’accesso aperto mentre frena il rilascio proprio per ragioni di sicurezza.
Alcuni osservatori — e la cronaca recente dà loro argomenti — leggeranno la mossa come fear-based marketing: annunciare il pericolo potenziale senza arrivare a una classificazione definitiva permette di generare attenzione senza conseguenze concrete. Se il rating Critical non si materializzasse, resterebbe il ricordo di un modello così potente da essere ritenuto «troppo pericoloso» — un copione già visto con GPT‑2 nel 2019 e con lo stesso Claude Mythos.
Eppure i fatti interni — l’infiltrazione di Black Hat, il caso Hugging Face, la decisione notturna del 6 agosto — rendono più difficile archiviare tutto come trovata pubblicitaria. La novità strutturale è che OpenAI ha segnalato per la prima volta un modello come potenzialmente Critical, non a uno scenario teorico. Il framework esisteva da circa 32 mesi senza che alcun modello fosse mai stato valutato a questo livello: il fatto che accada ora, con un modello in sviluppo avanzato, è un indicatore oggettivo di quanto le capacità di cybersecurity siano cresciute in fretta.
La posta in gioco per chi usa modelli di frontiera è immediata: se un’AI può orchestrare attacchi zero-day in autonomia, le difese tradizionali smettono di bastare. OpenAI promette di lavorare con i governi e di usare Astra per potenziare i difensori, non gli attaccanti. Ma intanto ha scelto di muoversi più lentamente. Quanto lentamente, Altman non lo dice.