Anthropic rilascia Claude Fable 5 con guardrail di cybersecurity

Claude Fable 5: Anthropic pubblica Mythos con guardrail di sicurezza

Claude Fable 5 è il primo modello di classe Mythos accessibile al pubblico, rilasciato da Anthropic il 9 giugno 2026. La sua uscita risolve a metà il dilemma che l'azienda affronta da aprile: come rendere disponibile una tecnologia capace di trovare vulnerabilità nel software senza consegnarla a chi la userebbe per attaccare. La risposta è un sistema di filtri che devia le query pericolose su un modello più vecchio, mantenendo intatte le capacità di coding e analisi avanzata.

Fable 5 e Mythos 5: stessa architettura, accessi diversi

Anthropic ha rilasciato contemporaneamente due prodotti distinti. Claude Fable 5 è la versione pubblica: usa lo stesso modello base di Claude Mythos 5, ma con guardrail attivi. Mythos 5 aggiorna invece Mythos Preview — distribuito ad aprile a un numero ristretto di partner industriali — ed è disponibile esclusivamente per le organizzazioni già approvate nel consorzio Project Glasswing, oltre a "ricercatori selezionati in ambito biologico".

Come avevamo riportato, Palo Alto Networks — uno dei partner Glasswing — aveva individuato oltre due dozzine di vulnerabilità critiche usando il modello Mythos. È precisamente quella capacità che Anthropic vuole tenere fuori dalla portata degli attaccanti, e che spiega l'intera architettura a due livelli.

Come funzionano i guardrail di Fable 5

I guardrail agiscono come un classificatore a monte. Quando una query riguarda cybersecurity, biologia o chimica in modalità rischiosa, il sistema non risponde con Fable 5: reindirizza la richiesta a Claude Opus 4.8. Lo stesso meccanismo scatta se Anthropic sospetta che l'utente stia tentando la distillation — l'addestramento di un modello più piccolo sulle risposte di Fable 5.

I dati iniziali indicano che il classificatore è accurato: il 95% delle sessioni Fable 5 gira interamente sul modello principale, senza mai ricorrere al fallback. Anthropic ha condotto oltre 1.000 ore di red-teaming interno e con organizzazioni esterne prima del rilascio, e non sono emersi jailbreak universali.

Il meccanismo è però calibrato per sbagliare sul lato della cautela. Diane Penn, head of product management di Anthropic, ha dichiarato: "We're trying to make improvements in a way that's beneficial, even if we don't have the perfect solution for every use case to start. […] We just ended up feeling like this was the best product choice for users to get the maximum value out of Fable 5."

Una conseguenza meno pubblicizzata: Anthropic impone ora una retention obbligatoria di 30 giorni su tutto il traffico Fable 5 e Mythos 5, anche per le imprese che avevano accordi di zero-retention. I dati non saranno usati per l'addestramento, ma per difendersi da nuovi jailbreak e ridurre i falsi positivi.

Anthropic rilascia Claude Fable 5 con guardrail di cybersecurity
Protezione e sicurezza nei sistemi di IA: il lucchetto simbolizza i guardrail implementati. Foto di Connor Scott McManus su Pexels

Prestazioni: dai benchmark alle valutazioni sul campo

Fable 5 porta miglioramenti documentati su software engineering, visual understanding e attività di knowledge work. La società di analytics Hex ha riportato che Fable 5 è il primo modello a raggiungere il 90% sul suo benchmark di analisi complessa. Genspark, piattaforma AI workspace, ha comunicato che Fable ha vinto tutti i test comparativi interni, con margini netti su UI design e game coding. La piattaforma di vibe-coding Base44 ha evidenziato la capacità di costruire applicazioni complete in un singolo passaggio.

Prezzi e disponibilità: la finestra gratuita si chiude il 22 giugno

Il pricing è fissato a $10 per milione di token in input e $50 per milione di token in output — il doppio rispetto a Claude Opus 4.8. Il rollout segue una finestra temporanea:

  • Fino al 22 giugno 2026: Fable 5 incluso nei piani Pro, Max, Team ed Enterprise seat-based senza costi aggiuntivi.
  • Dal 23 giugno 2026: rimosso dai piani in abbonamento; il suo utilizzo richiederà usage credits.
  • Fase successiva: Anthropic punta a reintegrarlo come funzionalità standard il prima possibile, senza date confermate.

La scelta di toglierlo temporaneamente dai piani fissi riflette la domanda molto alta e difficile da stimare che l'azienda si aspetta. Rakuten ha già segnalato l'utilità pratica del prezzo: "At the highest effort, Fable reflects on and validates its own work. For us, that's what makes highly autonomous operations possible — the extra thinking pays for itself."

Il nodo irrisolto tra sicurezza e pressione competitiva

Fable 5 è, nei fatti, un compromesso. Anthropic lo riconosce esplicitamente nel comunicato ufficiale: "We're working as quickly as we can to safely release Mythos-level capabilities in general access. To do so, we'll need highly robust safeguards that prevent the model's cyber capabilities from being misused — safeguards that we (and, to our knowledge, all other AI developers) have yet to develop."

Il contesto commerciale pesa. Anthropic — come OpenAI, che ad aprile aveva lanciato privatamente un modello con capacità cyber avanzate — si trova in corsa verso la quotazione in borsa e deve mostrare ai potenziali investitori un prodotto all'altezza. Rilasciare Fable 5 con guardrail permette di soddisfare entrambe le pressioni, senza risolvere nessuna delle due in modo definitivo.

Vale la pena di notare un calcolo implicito: se il 95% delle sessioni non attiva mai il fallback, vuol dire che i guardrail intercettano una quota molto piccola del traffico reale. Il sistema è preciso abbastanza da non rallentare i casi d'uso legittimi, ma proprio per questo la sua robustezza contro attori motivati resta la variabile aperta.

La scommessa di Anthropic è che il vantaggio difensivo — dare anche ai difensori accesso alle stesse capacità di Mythos — bilanci il rischio di abbassare la soglia di ingresso per chi vuole sfruttare vulnerabilità in sistemi critici. La risposta non arriverà dai benchmark, ma da come il modello si comporta quando esce dai laboratori.

Francesco Leone
Francesco Leone

Francesco Leone è un esperto in Intelligenza Artificiale con una profonda conoscenza in Machine Learning e Deep Learning. Attraverso la sua esperienza, ha contribuito allo sviluppo di soluzioni innovative in ambito di elaborazione del linguaggio naturale e visione artificiale, mirando a trasformare il modo in cui interagiamo con la tecnologia. Attivo nel settore con pubblicazioni e progetti su https://ital-ia.it/, Francesco si dedica alla ricerca e all'applicazione di algoritmi avanzati per rendere i sistemi più intelligenti e accessibili.

Articoli: 552

Lascia una risposta

Il tuo indirizzo email non sarà pubblicato. I campi obbligatori sono contrassegnati *