Anthropic ritira la policy che limitava segretamente i ricercatori AI rivali

Claude Fable 5: Anthropic elimina i filtri segreti anti-ricercatori AI

Anthropic aveva nascosto nel system card di Claude Fable 5 una misura che avrebbe penalizzato silenziosamente chi usa il modello per sviluppare AI concorrenti. La scoperta ha scatenato proteste immediate nella comunità di ricerca, e l'11 giugno 2026 la società ha fatto marcia indietro: «Abbiamo fatto il tradeoff sbagliato e ci scusiamo per non aver trovato il giusto equilibrio». La vicenda espone una tensione strutturale: Anthropic è al tempo stesso fornitore di strumenti per la ricerca AI e attore diretto in quella stessa ricerca.

La misura nascosta nel system card di Fable 5

Claude Fable 5, rilasciato il 9 giugno 2026, includeva guardrail di sicurezza aggiuntivi rispetto alle versioni precedenti. Per le richieste legate a cybersecurity, biologia e chimica, Anthropic aveva scelto un approccio visibile: reindirizzamento esplicito verso Claude Opus 4.8, con notifica all'utente. Per i ricercatori che usavano Fable 5 per addestrare modelli AI frontier, invece, aveva optato per la discrezione: le risposte sarebbero state degradate senza che l'utente ne fosse informato.

La policy era sepolta nel system card del modello. Anthropic già vieta nei propri termini di servizio l'uso di Claude per sviluppare modelli concorrenti; questa misura aggiungeva una penalizzazione silenziosa per chi lo violava — o anche solo rischiava di farlo. Come avevamo riportato in precedenza, Anthropic degradava silenziosamente circa lo 0,03% del traffico senza notificare l'utente: con Fable 5 quella logica veniva estesa e formalizzata verso un target preciso.

Anthropic ha dichiarato di aver adottato la misura perché Claude è diventato sempre più efficace nell'accelerare la ricerca AI, esprimendo la preoccupazione che l'intelligenza artificiale possa migliorare le proprie capacità più rapidamente di quanto la società riesca ad adattarsi.

Perché la ricerca AI ha reagito con durezza

La risposta della comunità scientifica è stata diretta. Dean Ball, senior fellow alla Foundation for American Innovation ed ex consigliere della Casa Bianca sull'intelligenza artificiale, ha definito il degrado delle performance di ricerca ML «scioccantemente ostile» e «una pessima figura» per Anthropic, sottolineando che la pratica limitava anche la collaborazione sulla sicurezza AI stessa.

Will Brown, research lead della startup open-source Prime Intellect, ha sintetizzato la critica nel modo più netto: «Sembrava che Anthropic stesse dicendo al pubblico: non ci fidiamo di nessun altro per fare ricerca AI. Siamo gli unici autorizzati a farla». Brown ha poi aggiunto: «È come se stessero iniziando a togliere la scala dietro di sé».

Anthropic ritira la policy che limitava segretamente i ricercatori AI rivali
Schermo di computer che visualizza righe di codice di programmazione. Foto di Daniil Komov su Pexels

Tra le conseguenze pratiche segnalate da Brown: le imprese di terze parti specializzate nel testare i modelli frontier per sicurezza, performance e affidabilità avrebbero potuto ricevere risposte degradate senza capirne le cause, compromettendo l'intero ciclo di valutazione indipendente.

Come cambiano le regole a partire da questa settimana

Nella comunicazione rilasciata l'11 giugno 2026 a WIRED, Anthropic ha annunciato che le richieste classificate come sviluppo di LLM frontier faranno da questa settimana fallback visibile su Opus 4.8, esattamente come già avviene per cyber e bio. Tramite API, ogni richiesta rifiutata riceverà un codice esplicito di motivazione — la funzione arriverà anche lato server-side nel giro di pochi giorni.

Anthropic ha spiegato l'intera logica: un guardrail nascosto è più difficile da sondare e aggirare, permette targeting preciso e pochi falsi positivi. Con la visibilità, la rete deve essere necessariamente più larga e più richieste benigne verranno intercettate. La società dice di stare lavorando a classificatori più precisi.

Il nodo irrisolto: conservazione dei dati e Microsoft

La retromarcia sui filtri non chiude tutte le controversie attorno a Fable 5. Il modello richiede che prompt e output vengano conservati per 30 giorni, estendibili a 2 anni se vengono rilevate violazioni di policy — un requisito legato ai nuovi classificatori di sicurezza. Secondo The Verge, Microsoft ha già scelto di escludere il modello dal picker interno per GitHub Copilot: tutti gli altri modelli Claude operano sotto regole di zero data retention, Fable 5 no.

Sul piano dell'analisi, la vicenda espone un paradosso operativo. Applicare la trasparenza in modo selettivo — visibile verso le minacce biotech, invisibile verso i ricercatori AI concorrenti — contraddiceva il principio su cui poggia la fiducia degli sviluppatori in Anthropic. La correzione è arrivata in meno di 48 ore dal rilascio del modello: un dato che misura direttamente l'intensità delle pressioni ricevute.

Il test reale per Anthropic sono ora i classificatori visibili: se il tasso di falsi positivi risulterà alto, sviluppatori legittimi — inclusi quelli che lavorano a valutazioni di sicurezza indipendenti — si troveranno sistematicamente bloccati. È questo il costo concreto che la società ha scelto di accettare in cambio della trasparenza.

Fonti

Francesco Leone
Francesco Leone

Francesco Leone è un esperto in Intelligenza Artificiale con una profonda conoscenza in Machine Learning e Deep Learning. Attraverso la sua esperienza, ha contribuito allo sviluppo di soluzioni innovative in ambito di elaborazione del linguaggio naturale e visione artificiale, mirando a trasformare il modo in cui interagiamo con la tecnologia. Attivo nel settore con pubblicazioni e progetti su https://ital-ia.it/, Francesco si dedica alla ricerca e all'applicazione di algoritmi avanzati per rendere i sistemi più intelligenti e accessibili.

Articoli: 553

Lascia una risposta

Il tuo indirizzo email non sarà pubblicato. I campi obbligatori sono contrassegnati *