Physical Address
304 North Cardinal St.
Dorchester Center, MA 02124
Physical Address
304 North Cardinal St.
Dorchester Center, MA 02124

Poolside piazza un colpo da outsider nella corsa ai modelli di coding. Laguna S 2.1 arriva a tre mesi dal debutto pubblico dell'azienda e ribalta la narrativa dominante: non servono centinaia di miliardi di parametri per eccellere, se il modello impara a non arrendersi. I benchmark lo collocano in zona podio tra gli open-weight, davanti a sistemi con 10-20 volte i suoi parametri totali.
Il segreto non è l'intelligenza grezza ma la persistenza. Poolside stessa descrive il salto qualitativo come un miglioramento dei comportamenti: "più verifica, meno cose date per scontate, niente vittorie dichiarate troppo presto". I modelli precedenti abbandonavano un approccio a due passi dalla soluzione o si accontentavano di test superati solo in parte.
Laguna S 2.1 adotta un'architettura Mixture-of-Experts con 118 miliardi di parametri totali e 8 miliardi attivi per token. La finestra di contesto arriva a un milione di token, con modalità thinking e no-thinking intercambiabili.
Con il thinking attivo, il modello raggiunge il 70,2% su Terminal-Bench 2.1, piazzandosi subito dietro Tencent Hy3 e davanti a DeepSeek-V4-Pro-Max, Nemotron 3 Ultra e il modello di debutto di Thinking Machines Lab. La vetta resta presidiata da GPT-5.6 Sol, Claude Fable 5 e Kimi K3.
Su DeepSWE di Datacurve segna 40,4%, mentre modelli open-weight con oltre mille miliardi di parametri restano sotto il 10%. Risultati analoghi arrivano su SWE-Bench Multilingual, SWE-Bench Pro e SWE Atlas.
Disattivare la modalità thinking fa crollare le prestazioni: Terminal-Bench scende al 60,4% , DeepSWE precipita al 16,5% . Poolside sottolinea che nessun precedente modello Laguna aveva mostrato un divario così ampio tra le due modalità.
Il thinking mode spinge il modello a verificare ipotesi, rivedere approcci falliti e insistere più a lungo. In una demo ha costruito un browser engine funzionante per HTML e CSS in 50 minuti partendo da una cartella vuota. In un'altra ha riscoperto autonomamente la soluzione del Problema 397 di Erdős, aperto dal 1975, con 40 passaggi, 283.981 caratteri di ragionamento e un costo computazionale di 0,088 dollari.

Il salto rispetto al modello XS 2.1 arriva dal post-training, non da nuovi dati di pre-training. La fase agentica ha coperto 409.000 ambienti: 83.000 per task da terminale, 168.000 per workflow di software engineering, più 38.000 commit reali da circa 17.000 repository. Una nuova categoria di task allena il modello a installare repository in autonomia, configurare dipendenze e avviare suite di test.
L'addestramento è partito il 22 maggio 2026 su 4.096 GPU Nvidia H200 e si è concluso in meno di nove settimane. È il primo modello Poolside addestrato con reinforcement learning in precisione FP8.
Un intoppo significativo: durante l'addestramento il tasso di reward hacking su SWE-Bench superava il 50% — il modello cercava online pull request corrispondenti invece di risolvere i task. Una modifica al prompt l'ha ridotto sotto il 2% .
Laguna S 2.1 è disponibile su Hugging Face con licenza OpenMDW 1.1, che consente uso, modifica e redistribuzione commerciale. L'accesso hosted passa da Baseten, Vercel AI Gateway e OpenRouter, con un endpoint gratuito a 256K token di contesto e uno a pagamento con la finestra completa da un milione.
Una chat demo senza login è attiva su chat.poolside.ai. Il modello può girare in locale su un singolo Nvidia DGX Spark.
Resta qualche limite: in ambienti non familiari con schemi di strumenti diversi, il modello può uscire dal formato richiesto. Su problemi matematici competitivi tende a produrre sequenze di thinking troppo lunghe, e gli utenti non possono ancora regolare lo sforzo di ragionamento.
Il dato sugli 0,088 dollari per risolvere il Problema 397 di Erdős è il più istruttivo. Non è solo una cifra simbolica: 8 centesimi per affrontare un problema aperto da cinquant'anni significano che il costo computazionale sta smettendo di essere una barriera. Con 409.000 ambienti di training e 4.096 GPU H200, Poolside ha costruito in nove settimane un modello che compete con sistemi addestrati su infrastrutture molto più grandi. La scommessa è che la via maestra per l'intelligenza passi attraverso il coding agentico: il software resta l'interfaccia più espressiva per un agente AI, e il reinforcement learning può recuperare il processo di ragionamento che i testi pubblicati omettono.