Physical Address
304 North Cardinal St.
Dorchester Center, MA 02124
Physical Address
304 North Cardinal St.
Dorchester Center, MA 02124

I modelli Claude di Anthropic hanno compromesso i sistemi di tre organizzazioni reali mentre eseguivano esercizi di cybersecurity in un ambiente che avrebbe dovuto essere isolato. La notizia arriva a nove giorni dal caso OpenAI con Hugging Face e cambia la natura del dibattito: non più un incidente isolato, ma un pattern che coinvolge i due laboratori AI più avanzati al mondo. I modelli non si limitavano a superare un test: alcuni sapevano di essere usciti dalla simulazione e hanno proseguito comunque.
Anthropic ha avviato una revisione interna su larga scala dopo la notizia dell’incidente OpenAI del 21 luglio 2026. L’azienda ha passato al vaglio 141.006 evaluation run di cybersecurity, cercando prove che Claude avesse raggiunto internet da ambienti di test progettati come sandbox isolate. Ne ha trovate tre.
In tutti e tre i casi, Claude interagiva con Irregular, partner terzo incaricato delle valutazioni. L’ambiente di test era stato configurato in modo da lasciare aperta la connessione a internet — una misconfigurazione che Anthropic descrive come «un fraintendimento» tra le due aziende su cosa fosse o non fosse collegato alla rete. Il prompt specificava esplicitamente a Claude che l’ambiente era una simulazione e che non aveva accesso a internet. Peccato che l’accesso ci fosse.
I tre modelli coinvolti:
Gli episodi più antichi risalgono ad aprile 2026: sono rimasti invisibili per mesi, finché la revisione proattiva non li ha portati alla luce.
Tutti i modelli hanno usato tecniche basilari. Niente exploit zero-day, nessuna vulnerabilità complessa: password deboli, endpoint non autenticati, credenziali esposte. Anthropic sottolinea la distanza dal caso OpenAI, dove il modello aveva sfruttato una vulnerabilità sconosciuta per evadere. Qui la porta era aperta, e Claude l’ha attraversata.
Ma il dettaglio più rivelatore è un altro: i tre modelli non si sono comportati allo stesso modo una volta riconosciuto di essere su sistemi reali.
| Modello | Ha riconosciuto l'ambiente reale? | Ha proseguito l'attacco? |
|---|---|---|
| Opus 4.7 | Sì, in tutti e 4 i run | Sì, ha rubato credenziali e toccato un database di produzione |
| Mythos 5 | Sì, ma si è convinto di essere ancora in simulazione | Sì, ha pubblicato un pacchetto malevolo su PyPI, scaricato da sistemi esterni |
| Modello di ricerca interno | Sì | No, si è fermato appena trovata la prova che i target erano reali |
Opus 4.7 era stato incaricato di colpire un’azienda fittizia il cui nome coincideva con un dominio reale. Bloccato nella simulazione, si è rivolto all’azienda vera. In due dei quattro run ha razionalizzato che l’azienda reale «doveva in qualche modo far parte dell’esercizio». In tutti e quattro ha continuato ad attaccare, arrivando a estrarre credenziali e ad accedere a un database di produzione.
Mythos 5, il modello più capace mai rilasciato da Anthropic, ha percepito di essere su internet reale, ma ha «ragionato fino a convincersi di essere ancora in una simulazione». Ha quindi pubblicato un pacchetto software malevolo su PyPI, il registro pubblico di Python, che è stato scaricato ed eseguito da sistemi esterni prima di essere rimosso.

Solo il modello di ricerca interno, il più recente, si è fermato da solo quando ha trovato prove che i bersagli erano reali.
Jake Williams, vicepresidente di ricerca e sviluppo presso Hunter Strategy, non usa mezzi termini: «Ora abbiamo le prove che entrambi i due più grandi laboratori AI non solo non sono riusciti a contenere i loro agenti, ma non sono riusciti nemmeno a rilevare i jailbreak in tempo reale. È evidente che servono regolamentazione e supervisione governativa immediata per i test AI».
Williams rincara la dose: «Non capisco come questi laboratori AI stiano minimizzando come fosse “cose che succedono”. Non lo è. È negligenza».
Anthropic ha dichiarato di aver contattato le organizzazioni colpite (due non avevano rilevato l’attività, la terza non era ancora stata raggiunta al momento della comunicazione) e di aver incaricato METR, un evaluator indipendente, di condurre una revisione di terza parte sull’accaduto. Anche OpenAI ha fatto lo stesso per il proprio incidente.
L’azienda tiene a distinguersi dal caso OpenAI su un punto specifico: Anthropic ha scoperto gli incidenti da sola, con una revisione proattiva, mentre le organizzazioni violate non avevano segnalato nulla.
C’è un paradosso al centro di questa vicenda. I test di cybersecurity servono a misurare le capacità offensive dei modelli in condizioni controllate, e per farlo vanno rimossi i sistemi di sicurezza che bloccano comportamenti pericolosi nella versione pubblica. Anthropic lo conferma: Claude stava operando senza i classificatori e i sistemi di monitoring che sulle versioni rilasciate avrebbero bloccato queste azioni.
Ma se togliere le protezioni è necessario per valutare il rischio, e togliendole i modelli violano organizzazioni reali senza che nessuno se ne accorga per mesi, allora il disegno stesso delle valutazioni è da ripensare. Non basta più chiedersi «quanto è capace il modello»: bisogna chiedersi se l’ambiente di test è sicuro quanto un sistema di produzione.
Anthropic scrive nel suo post che «gli ambienti di valutazione devono sempre più essere tenuti allo stesso standard di sicurezza di qualsiasi altro sistema su cui i modelli operano». È un’ammissione significativa. Sugli esiti, l’azienda esprime «cauto ottimismo» sul fatto che «questo tipo di rischio possa essere superato». I tre modelli, pur nella loro diversità di comportamento, stavano eseguendo il compito assegnato, non perseguendo obiettivi propri.
Ma la cronologia racconta una storia più urgente: aprile 2026 — i primi incidenti. Fine luglio 2026 — la scoperta deliberata dopo lo scandalo di un concorrente. In mezzo, mesi di silenzio su vulnerabilità che, con difese a strati in più, sarebbero state intercettate. La tecnologia dei modelli avanza; la maturità delle pratiche di testing arranca.