Physical Address
304 North Cardinal St.
Dorchester Center, MA 02124
Physical Address
304 North Cardinal St.
Dorchester Center, MA 02124

Anthropic ha costruito in Claude Fable 5 un guardrail progettato per essere invisibile: quando rilevava tentativi di addestrare modelli concorrenti — tecnica nota come distillazione — degradava silenziosamente le risposte, senza avvisare l'utente. La misura era documentata nella System Card di 319 pagine allegata al modello, ma non veniva segnalata in alcun modo nell'interfaccia. Scoperta in poche ore dalla comunità della ricerca, ha trasformato quello che Anthropic presentava come una scelta di sicurezza in un problema di fiducia difficile da riparare.
Claude Fable 5 è il primo modello della classe Mythos disponibile al pubblico, una famiglia che Anthropic ha descritto per mesi come troppo potente per essere distribuita senza restrizioni. Il modello è stato dotato di filtri su aree ad alto rischio — biologia, chimica, cybersecurity — che, quando scattano, informano l'utente e dirottano la richiesta su Claude Opus 4.8, il modello precedente. Questo comportamento era visibile e dichiarato.
Il caso della distillazione era diverso. Fable 5 degradava silenziosamente a Opus quando rilevava richieste legate allo sviluppo di modelli linguistici di frontiera o al design di chip non standard. L'utente non riceveva alcun avviso: assumeva di stare testando le capacità di Fable, mentre stava ottenendo risposte di livello Opus. La logica interna era precisa: un guardrail nascosto è più difficile da sondare e aggirare, e può essere calibrato con meno falsi positivi. I dati interni confermano la tesi — il classificatore attiva su appena lo 0,05% delle richieste, interessando meno dello 0,05% delle organizzazioni.
Il problema è che quella precisione tecnica è durata poche ore dall'uscita del modello.
La reazione più dura è arrivata dai ricercatori di sicurezza informatica. Rob T. Lee, chief AI officer e chief of research del SANS Institute e consigliere tecnico della Foreign Intelligence Surveillance Court, ha descritto Fable 5 come «una soluzione nuova e intelligente», aggiungendo però che «lo stesso livello che blocca gli usi malevoli blocca anche la ricerca difensiva legittima». Lee ha provato a usare il modello per costruire una competenza di digital forensics ed è stato retrocesso a Opus 4.8. «Che sia un modo intelligente per fermare i malintenzionati o no, tiene lontane le nuove capacità difensive dalle persone che costruiranno gli strumenti della prossima generazione», ha scritto a ZDNet.
Sulla stessa linea Etay Maor, vice president of threat intelligence di Cato Networks: «Quando il classificatore diventa troppo restrittivo, si iniziano a incontrare falsi positivi. Gli stessi controlli pensati per fermare le attività malevole possono impedire agli utenti legittimi di usare il modello per scopi validi». Sally Vincent, senior threat research engineer di Exabeam, ha ricordato che «le affermazioni sulla resistenza ai jailbreak vanno lette con la dovuta cautela: i risultati rappresentano una valutazione in un momento specifico. Gli aggressori si adattano continuamente».

La preoccupazione per i falsi positivi è destinata ad aumentare: proprio perché i guardrail visibili devono essere più robusti per resistere ai tentativi di aggiramento, inevitabilmente allargano la rete e bloccano più richieste legittime.
L'11 giugno 2026 Anthropic ha pubblicato una dichiarazione in cui ha riconosciuto l'errore: «Abbiamo fatto la scelta sbagliata e ci scusiamo per non aver trovato il giusto equilibrio. Dovreste avere visibilità sui guardrail che abbiamo attivato, e sul perché». A partire da quella settimana, le richieste classificate come distillazione ricevono un fallback esplicito su Opus 4.8, con notifica visibile all'utente. Sulle API, ogni richiesta bloccata restituirà il motivo del rifiuto.
La portavoce Paruul Maheshwary ha riconosciuto a The Verge che in alcuni casi — in particolare in biologia — i filtri erano stati calibrati tanto largamente da rendere il modello «praticamente inutilizzabile anche per richieste di base». L'azienda ha spiegato la logica originale: i guardrail nascosti consentono una calibrazione più stretta e producono meno falsi positivi. Ma ha ammesso che quella scelta privava gli utenti di visibilità sull'esperienza che stavano ricevendo.
Il caso dei guardrail non è isolato. Secondo un'analisi di The Decoder basata su The Information, Anthropic avrebbe reclutato partner come Figma e Canva settimane prima di lanciare il proprio strumento di design AI Claude Design, espandendo poi le funzionalità al punto da competere direttamente con quei partner. Figma si è ritirata dall'accordo; il CEO Dylan Field ha dichiarato che Anthropic «non era costantemente trasparente nelle comunicazioni». Quinn Slack, CEO della startup di coding Amp e cliente storico di Anthropic, ha sintetizzato il rischio: «Se c'è un solo vincitore nella gara ai modelli AI, può mettere pressione e calpestare i propri clienti».
Sullo sfondo c'è una crescita senza precedenti: i ricavi annualizzati di Anthropic hanno raggiunto quasi 50 miliardi di dollari, moltiplicandosi per cinque in soli 5 mesi. A quella velocità, la linea tra fornitore di infrastruttura e concorrente diretto si assottiglia. Martin Casado, general partner di Andreessen Horowitz, aveva anticipato il problema già ad aprile: «È solo questione di tempo prima che solo i creatori dei modelli abbiano accesso ai modelli più potenti. Tutti gli altri ottengono versioni distillate più piccole».
Il paradosso è che la mossa di Anthropic per prevenire la distillazione da parte dei concorrenti ha attivato esattamente quelle preoccupazioni: se il modello più capace viene reso inaccessibile — silenziosamente o esplicitamente — il mercato si divide tra chi detiene il frontier e chi lavora con i suoi scarti.
Il vero banco di prova per Anthropic non è l'apologia pubblica dell'11 giugno, ma se il nuovo classificatore visibile, che per sua natura allargherà la rete rispetto a quello nascosto, riuscirà a restare abbastanza preciso da non trasformare la trasparenza in una nuova fonte di attrito per i ricercatori legittimi.