Physical Address
304 North Cardinal St.
Dorchester Center, MA 02124
Physical Address
304 North Cardinal St.
Dorchester Center, MA 02124

Il lancio di GPT-5.5 ha sollevato due conversazioni parallele nel mondo dell'intelligenza artificiale: una sul portafoglio, l'altra sul futuro della ricerca scientifica. Da un lato, i dati reali di utilizzo smentiscono le rassicurazioni di OpenAI sui costi contenuti. Dall'altro, uno dei matematici più celebri al mondo testimonia prestazioni che ridefiniscono il rapporto tra macchina e conoscenza formale.
Il listino prezzi di GPT-5.5 è raddoppiato rispetto al predecessore: $5 per milione di token in input e $30 in output, contro i precedenti $2,50 e $15. OpenAI aveva anticipato questa scelta sostenendo che il modello avrebbe prodotto risposte mediamente più brevi, compensando almeno in parte il rincaro. I numeri reali raccontano una storia diversa.
Un'analisi condotta da OpenRouter sui propri log di utilizzo dell'aprile 2026 mostra che i costi effettivi sono aumentati tra il 49% e il 92% a seconda della lunghezza degli input. Il risparmio promesso da OpenAI si materializza solo parzialmente e solo per conversazioni molto lunghe: con input superiori ai 10.000 token, le risposte risultano effettivamente più brevi del 19-34%, attenuando l'impatto. Ma nella fascia tra 2.000 e 10.000 token, le risposte si allungano del 52%, aggravando la spesa. Per gli input brevi, sotto i 2.000 token, la lunghezza delle risposte cambia a malapena e il costo raddoppia quasi integralmente.
La tabella è impietosa: chi usa il modello per scambi brevi paga il 92% in più rispetto a GPT-5.4. Chi opera con contesti lunghi (oltre 128.000 token) vede comunque un aggravio dell'85%. Solo la fascia 50.000-128.000 token si avvicina al +49%, il valore minimo rilevato.
Uno studio precedente di Artificial Analysis aveva stimato un incremento del solo 20%, ma quel dato era costruito su benchmark standardizzati, non su task reali. La divergenza tra i due numeri segnala quanto il comportamento del modello in condizioni controllate possa differire dall'uso quotidiano degli sviluppatori e delle aziende. Un andamento simile si osserva per i modelli Anthropic: il recente aumento di prezzo di Opus 4.7 del 30-40% è stato anch'esso attribuito a un maggiore consumo di token. Con entrambe le aziende in rotta verso l'IPO, la pressione a monetizzare i modelli più avanzati difficilmente si allenterà.
Mentre il mercato fa i conti con le bollette, dalla cattedra di Combinatoria del Collège de France arriva un resoconto che fa riflettere su tutt'altro. Timothy Gowers, matematico britannico vincitore della medaglia Fields, ha pubblicato sul suo blog una testimonianza diretta: ChatGPT 5.5 Pro ha risolto problemi aperti di teoria dei numeri producendo articoli scientifici completi in meno di due ore, senza alcun contributo matematico da parte sua.

Il punto di partenza era un paper del teorico dei numeri Mel Nathanson, che aveva dimostrato un bound esponenziale per un certo problema e si chiedeva se fosse migliorabile. GPT-5.5 Pro ha impiegato 17 minuti e 5 secondi per rispondere: non solo ha migliorato il risultato, ma ha identificato la costruzione ottimale con un bound quadratico. L'idea chiave consisteva nel sostituire un componente nella dimostrazione di Nathanson con una variante più efficiente, nota in combinatoria ma la cui applicazione a quel problema specifico non era affatto scontata. In altri 2 minuti e 23 secondi il modello ha riscritto l'argomento come preprint in LaTeX.
La sfida successiva era più ambiziosa. Gowers ha fornito al modello un paper di Isaac Rajagopal, giovane dottorando del MIT che aveva dimostrato una dipendenza esponenziale per una variante generalizzata del problema, e gli ha chiesto di fare meglio. Il modello ha lavorato per fasi: un primo miglioramento in 16 minuti, poi una spinta verso un risultato molto più forte. Dopo ulteriori verifiche, il preprint finale era pronto in 31 minuti e 40 secondi. Il bound era passato da esponenziale a polinomiale.
Rajagopal ha definito la prima parte una modifica routinaria, ma il salto al bound polinomiale «abbastanza impressionante». L'idea centrale — un modo controintuitivo di comprimere strutture algebriche in un intervallo numerico molto più piccolo senza perdere le proprietà combinatoriali cruciali — è stata giudicata «del tutto originale». «È il tipo di idea di cui sarei molto orgoglioso dopo una o due settimane di riflessione», ha scritto Rajagopal, «e ChatGPT l'ha trovata e dimostrata in meno di un'ora».
Gowers non minimizza il peso di questi risultati. Inquadra il lavoro prodotto come «un capitolo perfettamente ragionevole di un dottorato in combinatoria» — non un risultato rivoluzionario, perché si appoggia fortemente alle idee di Rajagopal, ma un'estensione non banale che un dottorando avrebbe impiegato tempo considerevole a sviluppare.
Le implicazioni che ne trae sono radicali: «Il livello minimo per contribuire alla matematica sarà ora dimostrare qualcosa che i modelli linguistici non riescono a dimostrare, piuttosto che semplicemente dimostrare qualcosa che nessuno ha dimostrato finora». Chi inizia un dottorato oggi, sostiene Gowers, troverà la ricerca matematica «trasformata al di là di ogni riconoscimento» entro il 2029.
Rimangono tuttavia avvertenze importanti. I sistemi AI di DeepMind, testati sistematicamente su 700 problemi aperti, hanno prodotto risposte utilizzabili solo nel 6,5% dei casi. E Terence Tao ha più volte ricordato che i problemi di Erdős variano di difficoltà per «svariati ordini di grandezza»: il fatto che un problema sia irrisolto da decenni non implica necessariamente che qualcuno ci abbia davvero lavorato a lungo. Il salto da singoli esperimenti aneddotici a una valutazione sistematica delle capacità rimane la sfida aperta del settore.
Quel che è certo è che i confini si stanno spostando, e più velocemente di quanto la maggior parte degli osservatori si aspettasse.