Sakana Fugu: modello orchestrato che compete con Anthropic Fable 5

Sakana Fugu: l’orchestratore che rivaleggia con Fable 5 senza usarlo

Sakana AI ha lanciato Fugu, un sistema che coordina dinamicamente più modelli linguistici comportandosi come un singolo LLM per l'utente. Il risultato è notevole: secondo Sakana AI, Fugu Ultra si comporta al medesimo livello di Anthropic Fable 5 e Mythos nei benchmark di coding e ragionamento — anche se questi modelli non sono inclusi direttamente nella comparazione pubblicata, poiché non pubblicamente disponibili.

Come funziona: un modello che dirige altri modelli

Fugu è esso stesso un LLM, addestrato a invocare altri modelli da un pool intercambiabile, incluse copie di sé. A seconda del compito risolve in autonomia o assembla un team di specialisti; selezione, delegazione, verifica e sintesi avvengono internamente. L'accesso avviene tramite un'unica API compatibile con lo standard OpenAI.

La startup di Tokyo — che con il suo agente ALE-Agent si era già piazzata 21ª su 1.000 esperti umani in una gara di coding — propone due varianti:

Sakana Fugu: modello orchestrato che compete con Anthropic Fable 5
Un laptop visualizza codice sorgente in una stanza poco illuminata, con una tazza di caffè accanto. Foto di Daniil Komov su Pexels
  • Fugu base: bassa latenza per coding quotidiano, code review e chatbot
  • Fugu Ultra: qualità massima per ricerca scientifica, analisi cybersecurity e ricerche brevettuali

I benchmark di Fugu contro i modelli frontier

BenchmarkFuguFugu UltraOpus 4.8Gemini 3.1 ProGPT 5.5
SWE Bench Pro59.073.769.254.258.6
LiveCodeBench92.993.287.888.585.3
Humanity's Last Exam47.250.049.844.441.4
GPQA-D95.595.592.094.393.6
Long-Context Reasoning74.773.367.772.774.3
MRCRv286.693.687.984.994.8

Su SWE Bench Pro — il benchmark più severo per coding agent — Fugu Ultra segna 73.7 contro il 69.2 di Opus 4.8 (4,5 punti di vantaggio calcolato direttamente) e il 58.6 di GPT-5.5 (15,1 punti). I dati rivelano però un dettaglio controintuitivo: su SciCode (58.7 vs 60.1), τ³ Banking (20.6 vs 21.7) e Long-Context Reasoning (73.3 vs 74.7), è la variante base a superare Ultra. L'orchestrazione intensiva di Fugu Ultra non migliora uniformemente ogni categoria. L'unico fronte dove Fugu Ultra cede a un concorrente esterno è MRCRv2, dove GPT-5.5 raggiunge 94.8 contro 93.6.

Circa 500 beta tester hanno già usato il sistema in contesti reali; un developer ha segnalato che Fugu Ultra rileva oltre venti problemi in code review dove altri strumenti ne individuano circa tre.

Fugu come copertura contro il vendor lock-in

Sakana AI posiziona Fugu anche come salvaguardia contro la dipendenza da un singolo fornitore. "Per un'organizzazione o una nazione, affidarsi alle API di una sola azienda per infrastrutture critiche, finanza o governance è una vulnerabilità materiale. Questo rischio non è più un'ipotesi, ma una realtà", scrive la società nel suo annuncio. Il pool di agenti è completamente intercambiabile: se un provider diventa inaccessibile — come è già avvenuto con i modelli Anthropic, bloccati agli utenti stranieri dagli Stati Uniti come avevamo riportato — il sistema reindirizza altrove.

L'approccio si basa sui paper Trinity e Conductor presentati all'ICLR 2026 e riflette la visione di Sakana di un'AI come ecosistema collettivo, non come modello unico. Il vero banco di prova non sarà nei benchmark che Sakana pubblica in proprio, ma nella capacità di mantenere quei numeri quando i modelli del pool vengono aggiornati, rimpiazzati o bloccati da nuove regolamentazioni — esattamente il rischio che Fugu dichiara di voler risolvere.

Fonti

Francesco Leone
Francesco Leone

Francesco Leone è un esperto in Intelligenza Artificiale con una profonda conoscenza in Machine Learning e Deep Learning. Attraverso la sua esperienza, ha contribuito allo sviluppo di soluzioni innovative in ambito di elaborazione del linguaggio naturale e visione artificiale, mirando a trasformare il modo in cui interagiamo con la tecnologia. Attivo nel settore con pubblicazioni e progetti su https://ital-ia.it/, Francesco si dedica alla ricerca e all'applicazione di algoritmi avanzati per rendere i sistemi più intelligenti e accessibili.

Articoli: 553

Lascia una risposta

Il tuo indirizzo email non sarà pubblicato. I campi obbligatori sono contrassegnati *