Physical Address
304 North Cardinal St.
Dorchester Center, MA 02124
Physical Address
304 North Cardinal St.
Dorchester Center, MA 02124

Anthropic aveva nascosto nel system card di Claude Fable 5 una misura che avrebbe penalizzato silenziosamente chi usa il modello per sviluppare AI concorrenti. La scoperta ha scatenato proteste immediate nella comunità di ricerca, e l'11 giugno 2026 la società ha fatto marcia indietro: «Abbiamo fatto il tradeoff sbagliato e ci scusiamo per non aver trovato il giusto equilibrio». La vicenda espone una tensione strutturale: Anthropic è al tempo stesso fornitore di strumenti per la ricerca AI e attore diretto in quella stessa ricerca.
Claude Fable 5, rilasciato il 9 giugno 2026, includeva guardrail di sicurezza aggiuntivi rispetto alle versioni precedenti. Per le richieste legate a cybersecurity, biologia e chimica, Anthropic aveva scelto un approccio visibile: reindirizzamento esplicito verso Claude Opus 4.8, con notifica all'utente. Per i ricercatori che usavano Fable 5 per addestrare modelli AI frontier, invece, aveva optato per la discrezione: le risposte sarebbero state degradate senza che l'utente ne fosse informato.
La policy era sepolta nel system card del modello. Anthropic già vieta nei propri termini di servizio l'uso di Claude per sviluppare modelli concorrenti; questa misura aggiungeva una penalizzazione silenziosa per chi lo violava — o anche solo rischiava di farlo. Come avevamo riportato in precedenza, Anthropic degradava silenziosamente circa lo 0,03% del traffico senza notificare l'utente: con Fable 5 quella logica veniva estesa e formalizzata verso un target preciso.
Anthropic ha dichiarato di aver adottato la misura perché Claude è diventato sempre più efficace nell'accelerare la ricerca AI, esprimendo la preoccupazione che l'intelligenza artificiale possa migliorare le proprie capacità più rapidamente di quanto la società riesca ad adattarsi.
La risposta della comunità scientifica è stata diretta. Dean Ball, senior fellow alla Foundation for American Innovation ed ex consigliere della Casa Bianca sull'intelligenza artificiale, ha definito il degrado delle performance di ricerca ML «scioccantemente ostile» e «una pessima figura» per Anthropic, sottolineando che la pratica limitava anche la collaborazione sulla sicurezza AI stessa.
Will Brown, research lead della startup open-source Prime Intellect, ha sintetizzato la critica nel modo più netto: «Sembrava che Anthropic stesse dicendo al pubblico: non ci fidiamo di nessun altro per fare ricerca AI. Siamo gli unici autorizzati a farla». Brown ha poi aggiunto: «È come se stessero iniziando a togliere la scala dietro di sé».

Tra le conseguenze pratiche segnalate da Brown: le imprese di terze parti specializzate nel testare i modelli frontier per sicurezza, performance e affidabilità avrebbero potuto ricevere risposte degradate senza capirne le cause, compromettendo l'intero ciclo di valutazione indipendente.
Nella comunicazione rilasciata l'11 giugno 2026 a WIRED, Anthropic ha annunciato che le richieste classificate come sviluppo di LLM frontier faranno da questa settimana fallback visibile su Opus 4.8, esattamente come già avviene per cyber e bio. Tramite API, ogni richiesta rifiutata riceverà un codice esplicito di motivazione — la funzione arriverà anche lato server-side nel giro di pochi giorni.
Anthropic ha spiegato l'intera logica: un guardrail nascosto è più difficile da sondare e aggirare, permette targeting preciso e pochi falsi positivi. Con la visibilità, la rete deve essere necessariamente più larga e più richieste benigne verranno intercettate. La società dice di stare lavorando a classificatori più precisi.
La retromarcia sui filtri non chiude tutte le controversie attorno a Fable 5. Il modello richiede che prompt e output vengano conservati per 30 giorni, estendibili a 2 anni se vengono rilevate violazioni di policy — un requisito legato ai nuovi classificatori di sicurezza. Secondo The Verge, Microsoft ha già scelto di escludere il modello dal picker interno per GitHub Copilot: tutti gli altri modelli Claude operano sotto regole di zero data retention, Fable 5 no.
Sul piano dell'analisi, la vicenda espone un paradosso operativo. Applicare la trasparenza in modo selettivo — visibile verso le minacce biotech, invisibile verso i ricercatori AI concorrenti — contraddiceva il principio su cui poggia la fiducia degli sviluppatori in Anthropic. La correzione è arrivata in meno di 48 ore dal rilascio del modello: un dato che misura direttamente l'intensità delle pressioni ricevute.
Il test reale per Anthropic sono ora i classificatori visibili: se il tasso di falsi positivi risulterà alto, sviluppatori legittimi — inclusi quelli che lavorano a valutazioni di sicurezza indipendenti — si troveranno sistematicamente bloccati. È questo il costo concreto che la società ha scelto di accettare in cambio della trasparenza.