Physical Address
304 North Cardinal St.
Dorchester Center, MA 02124
Physical Address
304 North Cardinal St.
Dorchester Center, MA 02124

OpenAI ha annunciato che il suo nuovo modello di punta, GPT-5.6 Sol, ha raggiunto il 38,3% sul benchmark di ragionamento astratto ARC-AGI-3, superando di netto il 30,2% di Claude Opus 5 di Anthropic. Il primato però scivola via appena si guarda il dettaglio tecnico: con l’harness ufficiale del test, il punteggio crolla al 7,8%. La distanza tra i due risultati è un intero ecosistema applicativo costruito su misura da OpenAI, e mentre la comunità scientifica discute di regole e trasparenza, l’azienda sposta il baricentro della conversazione sull’efficienza computazionale, ridisegnando la sua offerta per servire 1 miliardo di utenti e oltre 2 milioni di aziende.
Il salto dal 7,8% al 38,3% dipende esclusivamente dall’ambiente di test. OpenAI ha utilizzato le proprie Responses API con due impostazioni non disponibili nell’harness ufficiale di ARC-AGI-3: il “Retained Reasoning”, che conserva la catena di pensiero del modello tra un passaggio e l’altro, e la “Compaction”, che riassume il contesto precedente invece di troncarlo. Di fatto, GPT-5.6 Sol conserva una memoria di lavoro che l’ambiente standard di ARC cancella dopo ogni azione.
I numeri del test, messi a confronto, descrivono una forbice che ha pochi precedenti:
| Modello / Setup | Punteggio ARC-AGI-3 |
|---|---|
| GPT-5.6 Sol (OpenAI Responses API) | 38,3% |
| Claude Opus 5 (Harness ufficiale) | 30,2% |
| GPT-5.6 Sol (Harness ufficiale) | 7,8% |
ARC Prize, l’organizzazione che gestisce il benchmark, ha risposto ai risultati ricordando che il test è progettato per misurare la capacità pura dei modelli con un approccio standardizzato, senza personalizzazioni legate allo specifico fornitore. Il punto critico, segnalato in ambienti tecnici riportati da The Decoder, è se il setup ufficiale utilizzasse le vecchie Chat Completions API di OpenAI, già superate dalle funzionalità che l’API di Claude offriva in partenza, creando uno svantaggio strutturale per GPT-5.6.
Nel post tecnico pubblicato il 29 luglio 2026, OpenAI ha dettagliato come la famiglia GPT-5.6 sia stata riprogettata per fondere intelligenza di frontiera ed efficienza. Il modello Sol è stato impiegato per riscrivere in autonomia i kernel di produzione nei linguaggi Triton e Gluon, portando a una riduzione del 20% dei costi end-to-end di inferenza. La stessa architettura “Sol in Codex” ha gestito centinaia di esperimenti sullo speculative decoding, migliorando l’efficienza nella generazione dei token di oltre il 15%.

L’intervento non si è fermato all’inferenza. L’harness agentico — lo strato di orchestrazione in Rust che connette modelli, strumenti e ambiente utente — introduce un cap predefinito di 10.000 token sull’output degli strumenti e utilizza un sistema di caricamento differito per integrazioni e skill, riducendo il “context bloat”. L’aggiunta di prompt caching deterministico, con contesto in sola append, massimizza il riutilizzo della cache, abbattendo ulteriore computazione ridondante.
Sul fronte commerciale, la famiglia GPT-5.6 si articola in tre modelli pensati per ogni punto della curva costo-intelligenza: Sol per il massimo ragionamento, Terra che eguaglia GPT-5.5 a metà prezzo, e Luna, prezzato l’80% meno di Sol.
La distanza fra il 7,8% ufficiale e il 38,3% “personalizzato” rappresenta un incremento di circa il 390% ottenuto semplicemente cambiando l’impianto di valutazione. È l’argomento più potente di OpenAI per sostenere che il benchmark non misura mai il solo modello ma anche l’infrastruttura che lo circonda, e che costringere GPT-5.6 in un harness più arretrato delle sue attuali API equivale a falsare il confronto.
ARC Prize ribatte che lo standard unico è l’unica garanzia di equità. La tensione è speculare a quanto già osservato nei test di coding e matematica: il risultato di vertice dipende sempre più dall’integrazione tra modello e strumento, e chi controlla le API detta anche i termini della competizione.
Per le aziende e gli sviluppatori, il messaggio operativo è netto: le prestazioni reali di GPT-5.6 Sol si sbloccano adottando le Responses API e l’harness di OpenAI. Non è solo una questione di punteggio su un benchmark, ma di capacità concreta di ridurre i costi del 20% e contenere il degrado del contesto negli agenti di produzione. Resta il fatto che, mentre OpenAI si smarca dai test terzi per costruire il proprio ecosistema di valutazione, l’onere di fidarsi di un “primato” costruito in casa ricade interamente su chi integra.