Physical Address
304 North Cardinal St.
Dorchester Center, MA 02124
Physical Address
304 North Cardinal St.
Dorchester Center, MA 02124

Quando un modello di AI diventa abbastanza potente da essere distribuito in collaborazione con il governo statunitense, i filtri di sicurezza smettono di essere un dettaglio tecnico e diventano il centro del dibattito. Claude Fable 5, rilasciato il 10 giugno 2026, ne è la prova: con 80,3% su SWE-Bench Pro porta capacità di coding senza precedenti al grande pubblico — e guardrail che hanno già suscitato reazioni decise proprio dai professionisti che più avrebbero da guadagnare dal modello. Il tutto a un prezzo quasi doppio rispetto al predecessore.
Su SWE-Bench Pro, benchmark che misura la risoluzione di problemi reali di software engineering su repository pubblici GitHub senza assistenza esterna, Fable 5 segna 80,3%: contro il 69,2% di Claude Opus 4.8, il 58,6% di GPT 5.5 e il 54,2% di Gemini 3.1 Pro.
Su Cognition FrontierCode, che testa task di coding in condizioni di produzione reale, il divario si allarga ulteriormente: Fable 5 tocca il 29,3%, contro il 13,4% di Opus 4.8 e il 5,7% di GPT 5.5.
| Modello | SWE-Bench Pro | FrontierCode |
|---|---|---|
| Claude Fable 5 | 80,3% | 29,3% |
| Claude Opus 4.8 | 69,2% | 13,4% |
| GPT 5.5 | 58,6% | 5,7% |
| Gemini 3.1 Pro | 54,2% | — |
L'AI researcher e accademico della University of Pennsylvania Ethan Mollick ha definito Fable un modello che «ha superato praticamente ogni altro modello pubblico che abbia mai usato, con un margine considerevole», capace di «lavorare fino a una dozzina di ore eseguendo specifiche di più pagine». Ha anche generato videogiochi completi — compresa una versione di Snake e una tratta dalle Elegie di Duino di Rilke — con un singolo prompt su Claude Code.
I test aziendali confermano la traiettoria. Stripe ha compresso cinque mesi di lavoro ingegneristico in pochi giorni; su una codebase Ruby da 50 milioni di righe, Fable ha completato in un giorno una migrazione che a un team completo avrebbe richiesto oltre due mesi. La società di analytics Hex ha ottenuto il 90% sul proprio benchmark di task analitici complessi.
La versione riservata ai partner, Claude Mythos 5, sale al 78% su ExploitBench per la cybersecurity — contro il 69% di Mythos Preview e il 40% di Opus 4.8. Ma le capacità più significative riguardano la ricerca scientifica.
Esperti interni di protein design hanno registrato un'accelerazione di 10x in fasi del processo di drug design. In test senza supporto umano, Mythos 5 ha selezionato siti di legame, lanciato strumenti di bioinformatica e corretto errori in autonomia: su 14 proteine bersaglio, 9 hanno prodotto candidati farmacologici ora in fase di studio.

In genomica, il modello ha lavorato in autonomia per oltre una settimana, compilando dati single-cell di milioni di cellule da 138 specie animali e addestrando un proprio modello di machine learning per l'identificazione cellulare cross-specie. Il risultato ha superato un modello recentemente pubblicato su Science, pur essendo 100 volte più piccolo. Anthropic prevede di pubblicare i risultati nei prossimi mesi.
Fable 5 usa classifier AI che reindirizzano le richieste sensibili verso Claude Opus 4.8 in tre aree: cybersecurity, biologia e chimica, distillation. Oltre il 95% delle sessioni non viene toccato dai filtri.
L'implementazione ha però provocato critiche immediate. Valentina "Chompie" Palmiotti, security researcher di IBM X-Force, ha scritto che «[Fable] rifiuta qualsiasi richiesta che possa essere tangenzialmente correlata alla cyber. Anche task innocui come leggere un blog post». Matt Suiche, veterano della cybersecurity e membro dello staff tecnico di Tolmo, ha descritto il meccanismo come «keyword-based: qualsiasi termine nel campo lessicale della 'cybersecurity' fa scattare i guardrail». Ha aggiunto una prospettiva più benevola: «è meglio intercettare più persone del necessario durante un rilascio del genere, e rilassare i guardrail nel tempo».
Il system card di 319 pagine contiene un dettaglio più controverso, evidenziato dal ricercatore Simon Willison: per le richieste legate allo sviluppo di LLM frontier — pipeline di pre-training, infrastrutture di training distribuito, design di acceleratori ML — Fable 5 non notifica l'utente né fa fallback a Opus. Interviene con «prompt modification, steering vectors o parameter-efficient fine-tuning» per limitare l'efficacia delle risposte, in modo invisibile. Anthropic stima l'impatto allo 0,03% del traffico, concentrato in meno dello 0,1% delle organizzazioni. Willison ha commentato di non essere «per niente entusiasta di un modello che corrompe silenziosamente le sue risposte su domande di design di acceleratori ML».
Come già riportato, Fable 5 e Mythos 5 costano $10 per milione di token in input e $50 per milione in output — il doppio di Claude Opus 4.8. L'accesso via API è immediato; per i piani in abbonamento, Fable 5 è incluso gratuitamente fino al 22 giugno 2026, poi richiederà crediti di utilizzo dedicati.
Mythos 5 resta riservato alle circa 200 organizzazioni in più di 15 paesi già ammesse a Project Glasswing. Il red-teaming esterno ha prodotto zero jailbreak universali in oltre 1.000 ore di test. Con il lancio, Anthropic impone un periodo di 30 giorni di retention dati su tutto il traffico Mythos — anche per chi aveva accordi di zero retention — per rilevare nuovi attacchi.
Calcolando il differenziale: a parità di volume, un'organizzazione che passa da Opus 4.8 a Fable 5 paga esattamente il doppio per ogni sessione. Le testimonianze raccolte da Anthropic — Stripe, Rakuten, Hex — indicano un rapporto output/costo favorevole sui task ad alta complessità, dove il modello riduce le iterazioni. Ma per chi usa il modello per attività con componenti di sicurezza informatica, il guadagno effettivo dipende da quanti prompt passeranno i classifier senza finire su Opus.
Il benchmark di Fable 5 non è in discussione. La vera variabile è la velocità con cui Anthropic affinerà i classifier: se la comunità della cybersecurity è quella più capace di segnalare i falsi positivi, bloccarla sistematicamente rallenta il processo di miglioramento di cui i guardrail hanno più bisogno.