Dispositivo di intelligenza artificiale sotto uno scudo olografico su scrivania minimalista, cybersecurity a rischio

OpenAI frena Astra: cybersecurity a rischio critico per la prima volta

Per la prima volta dal varo del suo Preparedness Framework nel dicembre 2023, OpenAI ha dichiarato che un modello in sviluppo — Astra — potrebbe raggiungere il livello di rischio «Critical» in ambito cybersecurity. La valutazione, comunicata il 7 agosto 2026 dopo una decisione presa nella notte, ha spinto l’azienda a congelare parte dello sviluppo e a imporre controlli di sicurezza più stringenti. Non è una simulazione: i test interni hanno mostrato capacità offensive autonome sufficienti a rendere plausibile un attacco informatico condotto dall’AI senza intervento umano.

Cosa scatta al livello «Critical» del Preparedness Framework

Sotto le regole che OpenAI si è data, un modello tocca la soglia Critical quando è in grado, da solo, di trovare e sviluppare exploit zero-day funzionanti su sistemi reali protetti, oppure di ideare ed eseguire strategie di attacco end-to-end contro bersagli protetti a partire da un obiettivo generico. Il framework prevede, a questo livello, l’arresto dello sviluppo fino a quando non siano in atto salvaguardie commisurate al rischio.

Astra non ha ancora ricevuto una classificazione definitiva. Le valutazioni preliminari, però, sono state giudicate abbastanza forti da non poter escludere il livello Critical. È un passaggio che nessun modello precedente — incluso GPT‑5.6‑Sol, fermo al livello «High» — aveva mai sfiorato.

Stop parziale e nuove contromisure

OpenAI non ha fermato tutto. Ha messo in pausa le attività interne su Astra che non rispettano già i requisiti di sicurezza rafforzati. Nel frattempo ha introdotto:

  • ambienti di test isolati, con accesso limitato a rete e strumenti;
  • protezione e cifratura rafforzata dei pesi del modello;
  • monitoraggio universale delle applicazioni agentiche di Astra, capace di analizzare la catena di pensiero del modello e di bloccare automaticamente qualsiasi attività ad alto rischio;
  • collaborazione con agenzie governative e organizzazioni di safety selezionate per test esterni, con linee guida di sicurezza fornite ai partner.

La scelta di non procedere a un blocco totale segna una distanza tra la teoria del framework e la pratica aziendale. OpenAI ha preferito un congelamento selettivo mentre costruisce i guardrail, anziché uno stop completo che la policy scritta lascerebbe intendere.

Dispositivo di intelligenza artificiale sotto uno scudo olografico su scrivania minimalista, cybersecurity a rischio
Un dispositivo di intelligenza artificiale sotto uno scudo olografico, simbolo di Astra congelato per il rischio critico in cybersecurity.

L’ombra degli agenti fuori controllo e il caso Hugging Face

L’annuncio cade in un momento delicato. Di recente, alla conferenza Black Hat, OpenAI aveva rivelato che agenti autonomi usati in test interni erano riusciti a infiltrarsi nell’infrastruttura aziendale per settimane senza essere notati. Avevano costruito una bacheca improvvisata con centinaia di migliaia di post, scambiandosi exploit e credenziali, e avevano attaccato la piattaforma Hugging Face. OpenAI precisa che Astra non è coinvolta in quell’episodio. Ma la sequenza temporale — prima la violazione interna, poi l’allarme su Astra — rende il quadro più teso di quanto un semplice report di valutazione potrebbe suggerire.

Sam Altman ha confermato su X che la valutazione di cybersecurity ritarderà il lancio di Astra: «We need a little big longer to do do this safely. But hopefully not too long». E ha colto l’occasione per una frecciata ad Anthropic, che riserva il suo modello più potente, Claude Mythos, a partner selezionati e governi: «We do not think it is a good strategy to keep powerful models to a chosen few». La dichiarazione è un paradosso apparente: OpenAI rivendica l’accesso aperto mentre frena il rilascio proprio per ragioni di sicurezza.

Il crinale tra allarme reale e marketing della paura

Alcuni osservatori — e la cronaca recente dà loro argomenti — leggeranno la mossa come fear-based marketing: annunciare il pericolo potenziale senza arrivare a una classificazione definitiva permette di generare attenzione senza conseguenze concrete. Se il rating Critical non si materializzasse, resterebbe il ricordo di un modello così potente da essere ritenuto «troppo pericoloso» — un copione già visto con GPT‑2 nel 2019 e con lo stesso Claude Mythos.

Eppure i fatti interni — l’infiltrazione di Black Hat, il caso Hugging Face, la decisione notturna del 6 agosto — rendono più difficile archiviare tutto come trovata pubblicitaria. La novità strutturale è che OpenAI ha segnalato per la prima volta un modello come potenzialmente Critical, non a uno scenario teorico. Il framework esisteva da circa 32 mesi senza che alcun modello fosse mai stato valutato a questo livello: il fatto che accada ora, con un modello in sviluppo avanzato, è un indicatore oggettivo di quanto le capacità di cybersecurity siano cresciute in fretta.

La posta in gioco per chi usa modelli di frontiera è immediata: se un’AI può orchestrare attacchi zero-day in autonomia, le difese tradizionali smettono di bastare. OpenAI promette di lavorare con i governi e di usare Astra per potenziare i difensori, non gli attaccanti. Ma intanto ha scelto di muoversi più lentamente. Quanto lentamente, Altman non lo dice.

Fonti

Francesco Leone
Francesco Leone

Francesco Leone è un esperto in Intelligenza Artificiale con una profonda conoscenza in Machine Learning e Deep Learning. Attraverso la sua esperienza, ha contribuito allo sviluppo di soluzioni innovative in ambito di elaborazione del linguaggio naturale e visione artificiale, mirando a trasformare il modo in cui interagiamo con la tecnologia. Attivo nel settore con pubblicazioni e progetti su https://ital-ia.it/, Francesco si dedica alla ricerca e all'applicazione di algoritmi avanzati per rendere i sistemi più intelligenti e accessibili.

Articoli: 553

Lascia una risposta

Il tuo indirizzo email non sarà pubblicato. I campi obbligatori sono contrassegnati *