Physical Address
304 North Cardinal St.
Dorchester Center, MA 02124
Physical Address
304 North Cardinal St.
Dorchester Center, MA 02124

A maggio 2026, il mercato degli agenti AI per il coding è più frammentato che mai: nessun singolo strumento domina su tutti i fronti, e i costi per chi li adotta in modo aggressivo possono toccare cifre da capogiro. Claude Code di Anthropic guida le classifiche sulla qualità del codice, mentre GPT-5.5 di OpenAI si porta avanti sui workflow da terminale — e un esperimento condotto dal fondatore di OpenClaw mostra dove può arrivare una strategia all-in sugli agenti: 1,3 milioni di dollari al mese in sole chiamate API.
SWE-bench Verified — lo standard di riferimento per la valutazione del coding dal 2024 — ha perso affidabilità il 23 febbraio 2026, quando il team Frontier Evals di OpenAI ha pubblicato un'analisi che ne smonta le fondamenta: il 59,4% dei problemi esaminati aveva test case difettosi o irrisolvibili, e ogni grande modello frontiera era in grado di riprodurre le soluzioni corrette dalla sola memoria usando l'ID del task. OpenAI ha smesso di pubblicare i propri punteggi su SWE-bench Verified e raccomanda SWE-bench Pro come sostituto.
Nonostante questo, SWE-bench Verified rimane utile per confronti direzionali. Su questa metrica, Claude Opus 4.7 — rilasciato il 16 aprile 2026 — segna 87,6%, rispetto al 80,8% della versione precedente. Su SWE-bench Pro, variante notevolmente più difficile, Opus 4.7 raggiunge il 64,3%, primo tra i modelli pubblicamente disponibili.
Su Terminal-Bench 2.0, che misura workflow da shell, scripting e automazione DevOps, lo scenario si ribalta: GPT-5.5 guida con 82,7% (dato confermato da OpenAI il 23 aprile 2026), mentre Claude Opus 4.7 si ferma al 69,4% e Gemini 3.1 Pro al 68,5%.
| Modello/Agente | SWE-bench Verified | SWE-bench Pro | Terminal-Bench 2.0 |
|—|—|—|—|
| Claude Opus 4.7 (Claude Code) | 87,6% | 64,3% | 69,4% |
| GPT-5.5 (OpenAI Codex) | ~88,7% (terze parti) | 58,6% | 82,7% |
| Gemini 3.1 Pro | — | 54,2% | 68,5% |
Un'avvertenza metodologica che vale sempre: lo stesso modello può mostrare differenze di 7 punti percentuali tra harness diversi. I numeri in tabella riflettono il modello e l'infrastruttura di valutazione specifica, non il modello in isolamento.

Peter Steinberger, fondatore del progetto open source OpenClaw e membro del team di OpenAI, gestisce con un gruppo di circa tre persone 100 istanze di Codex in parallelo nel cloud. Gli agenti svolgono compiti molto diversi tra loro:
In 30 giorni, il conto OpenAI API ha raggiunto 1,3 milioni di dollari, per 603 miliardi di token e 7,6 milioni di richieste. Il modello più usato è stato GPT-5.5. OpenAI copre direttamente questi costi.
Steinberger ha difeso la scelta dicendo di stare esplorando come si costruirebbe il software se il prezzo dei token non fosse un vincolo. Ha aggiunto che disattivare la sola modalità "Fast Mode" ridurrebbe la spesa del 70%. Il ROI, secondo lui, è alto: tutto ciò che il team produce è open source e compatibile sia con i modelli leader che con quelli open weight.
Il caso OpenClaw è l'estremo di uno spettro — pochi team hanno budget o giustificazione per replicarlo — ma fotografa la direzione in cui si muove il settore: agenti specializzati che operano in parallelo su task distinti, non un singolo assistente universale.
Un risultato pubblicato a maggio 2026 da Poetiq sposta l'attenzione dal modello all'infrastruttura che lo avvolge. Il sistema Meta-System di Poetiq costruisce automaticamente un harness di inferenza — uno strato di orchestrazione che controlla come il modello viene interrogato, come le risposte vengono strutturate e come le soluzioni vengono validate — senza modificare il modello e senza accedere ai suoi parametri interni.
Il banco di prova è LiveCodeBench Pro (LCB Pro, 25Q2), benchmark di competitive programming resistente alla contaminazione dei dati grazie a un aggiornamento continuo dei problemi e alla validazione su memoria e runtime, non solo sulla correttezza dell'output.
I risultati principali:
L'harness è stato costruito usando solo Gemini 3.1 Pro come modello base, poi applicato senza modifiche a tutti gli altri modelli testati — migliorandoli ciascuno. La qualità dell'orchestrazione può essere altrettanto determinante quanto la capacità del modello sottostante.
Tre indicazioni pratiche emergono dal quadro complessivo. Prima: SWE-bench Verified non è più sufficiente come unico criterio di scelta — va affiancato da SWE-bench Pro e da benchmark specifici per il proprio tipo di workflow (Terminal-Bench per DevOps, LCB Pro per codice algoritmico). Seconda: il costo dell'agenzia parallela scala molto più velocemente di quanto ci si aspetti — 1,3 milioni al mese con 100 agenti non è un errore contabile, è il prezzo della strategia attuale. Terza: l'harness può cambiare i risultati più del modello — investire nell'orchestrazione è una leva ancora sottovalutata dalla maggior parte dei team.
Il modello da scegliere dipende ancora dal contesto: Claude Code per compiti multi-file su codebase complesse, GPT-5.5 tramite Codex per workflow da terminale e DevOps. Ma la vera variabile competitiva nel 2026 non è il modello — è chi costruisce l'infrastruttura attorno a esso.