Physical Address
304 North Cardinal St.
Dorchester Center, MA 02124
Physical Address
304 North Cardinal St.
Dorchester Center, MA 02124

Sakana AI ha lanciato Fugu, un sistema che coordina dinamicamente più modelli linguistici comportandosi come un singolo LLM per l'utente. Il risultato è notevole: secondo Sakana AI, Fugu Ultra si comporta al medesimo livello di Anthropic Fable 5 e Mythos nei benchmark di coding e ragionamento — anche se questi modelli non sono inclusi direttamente nella comparazione pubblicata, poiché non pubblicamente disponibili.
Fugu è esso stesso un LLM, addestrato a invocare altri modelli da un pool intercambiabile, incluse copie di sé. A seconda del compito risolve in autonomia o assembla un team di specialisti; selezione, delegazione, verifica e sintesi avvengono internamente. L'accesso avviene tramite un'unica API compatibile con lo standard OpenAI.
La startup di Tokyo — che con il suo agente ALE-Agent si era già piazzata 21ª su 1.000 esperti umani in una gara di coding — propone due varianti:

| Benchmark | Fugu | Fugu Ultra | Opus 4.8 | Gemini 3.1 Pro | GPT 5.5 |
|---|---|---|---|---|---|
| SWE Bench Pro | 59.0 | 73.7 | 69.2 | 54.2 | 58.6 |
| LiveCodeBench | 92.9 | 93.2 | 87.8 | 88.5 | 85.3 |
| Humanity's Last Exam | 47.2 | 50.0 | 49.8 | 44.4 | 41.4 |
| GPQA-D | 95.5 | 95.5 | 92.0 | 94.3 | 93.6 |
| Long-Context Reasoning | 74.7 | 73.3 | 67.7 | 72.7 | 74.3 |
| MRCRv2 | 86.6 | 93.6 | 87.9 | 84.9 | 94.8 |
Su SWE Bench Pro — il benchmark più severo per coding agent — Fugu Ultra segna 73.7 contro il 69.2 di Opus 4.8 (4,5 punti di vantaggio calcolato direttamente) e il 58.6 di GPT-5.5 (15,1 punti). I dati rivelano però un dettaglio controintuitivo: su SciCode (58.7 vs 60.1), τ³ Banking (20.6 vs 21.7) e Long-Context Reasoning (73.3 vs 74.7), è la variante base a superare Ultra. L'orchestrazione intensiva di Fugu Ultra non migliora uniformemente ogni categoria. L'unico fronte dove Fugu Ultra cede a un concorrente esterno è MRCRv2, dove GPT-5.5 raggiunge 94.8 contro 93.6.
Circa 500 beta tester hanno già usato il sistema in contesti reali; un developer ha segnalato che Fugu Ultra rileva oltre venti problemi in code review dove altri strumenti ne individuano circa tre.
Sakana AI posiziona Fugu anche come salvaguardia contro la dipendenza da un singolo fornitore. "Per un'organizzazione o una nazione, affidarsi alle API di una sola azienda per infrastrutture critiche, finanza o governance è una vulnerabilità materiale. Questo rischio non è più un'ipotesi, ma una realtà", scrive la società nel suo annuncio. Il pool di agenti è completamente intercambiabile: se un provider diventa inaccessibile — come è già avvenuto con i modelli Anthropic, bloccati agli utenti stranieri dagli Stati Uniti come avevamo riportato — il sistema reindirizza altrove.
L'approccio si basa sui paper Trinity e Conductor presentati all'ICLR 2026 e riflette la visione di Sakana di un'AI come ecosistema collettivo, non come modello unico. Il vero banco di prova non sarà nei benchmark che Sakana pubblica in proprio, ma nella capacità di mantenere quei numeri quando i modelli del pool vengono aggiornati, rimpiazzati o bloccati da nuove regolamentazioni — esattamente il rischio che Fugu dichiara di voler risolvere.