Physical Address
304 North Cardinal St.
Dorchester Center, MA 02124
Physical Address
304 North Cardinal St.
Dorchester Center, MA 02124

Con 56 punti sull’Artificial Analysis Intelligence Index, Qwen3.8 Max raggiunge la parità con Claude Opus 4.8 e stacca GLM-5.2 (fermo a 51). Un balzo di 10 punti rispetto ai 46 di Qwen3.7 Max, che porta il modello di Alibaba nella top tier dei modelli linguistici. Il paradosso è che Kimi K3, con 57 punti, fa meglio e costa il 25 per cento in meno. Il risultato ridisegna la competizione: la corsa non è più solo a chi scrive meglio, ma a chi lo fa con il conto più leggero.
L’allineamento con Claude Opus 4.8 nasconde un’efficienza peggiorata. Secondo i dati raccolti da Artificial Analysis, un singolo task dell’Intelligence Index con Qwen3.8 Max costa 1,14 dollari, più del doppio rispetto agli 0,53 dollari della versione precedente. Kimi K3 ottiene un punto in più con soli 0,86 dollari a task, mentre GLM-5.2 scende a 0,57 dollari.
| Modello | Punteggio AA Intelligence Index | Costo per task |
|---|---|---|
| Qwen3.8 Max | 56 | $1,14 |
| Kimi K3 | 57 | $0,86 |
| GLM-5.2 | 51 | $0,57 |
| Qwen3.7 Max (precedente) | 46 | $0,53 |
I prezzi nominali sono scesi: input da 2,50 a 2,00 dollari per milione di token, output da 7,50 a 6,00 dollari, cache hit da 0,50 a 0,25 dollari. Ma l’aumento del numero di step necessari ha ribaltato il vantaggio. Qwen3.8 Max richiede 64 step per task invece dei 14 della versione 3.7, con un volume di token in ingresso moltiplicato per 15 perché il test reinvia l’intera cronologia della conversazione a ogni passaggio. Lavora in modo più approfondito, ma a un costo unitario che cancella la sforbiciata sui listini.
Sul benchmark orientato al lavoro GDPval-AA, Qwen3.8 Max guadagna 468 punti Elo e arriva a 1.739, superando Kimi K3 (1.685) e piazzandosi dietro soltanto a Claude Opus 5 (1.852). Il modello eccelle nei compiti professionali, ma paga la complessità: per completare un task impiega 64 step contro i 14 della generazione precedente. Le imprese che valutano l’adozione devono mettere nel conto una latenza più alta e una fattura API che lievita.

L’aumento di performance non è uniforme. AA-LCR, che misura la capacità di recuperare informazioni da testi molto lunghi, perde 2 punti. AA-Omniscience, che verifica se il modello risponde correttamente o ammette di non sapere, crolla di 10 punti. L’accuratezza rimane intorno al 31 per cento, ma il tasso di allucinazione sale dal 23 al 40 per cento. Qwen3.8 Max tende a indovinare molto più spesso invece di dichiarare ignoranza, un comportamento che può minare l’affidabilità in ambiti dove la precisione fattuale è critica.
Al di là dei benchmark, Qwen3.8-Max segna un cambio di strategia. “Meet Qwen3.8-Max — our most capable model to date. Next week, the open weights of Qwen3.8-Max will be released”, ha annunciato su X l’account ufficiale di Qwen il 3 agosto 2026. È la prima volta che un modello della fascia Max viene distribuito come open weight. I numeri sono da laboratorio avanzato: 2.400 miliardi di parametri totali, di cui 95 miliardi attivati a ogni elaborazione.
Alibaba ha addestrato il modello per portare a termine attività lunghe giorni in modo autonomo: dalla scrittura di codice per oltre 16 giorni fino alla riproduzione e al miglioramento di esperimenti scientifici partendo da zero. L’annuncio dei pesi aperti sposta la competizione sul terreno dell’accessibilità: chiunque potrà eseguire localmente un modello con capacità da laboratorio, a patto di avere l’infrastruttura per gestirne la scala.
Il quadro complessivo è quello di un modello che ha raggiunto i migliori, ma con una ricetta costosa e alcune ombre sull’affidabilità. La mossa open weight è il vero elemento di rottura: abbassa le barriere e porta la potenza di calcolo nelle mani di sviluppatori e aziende. Resta da capire se la comunità saprà gestire un modello che, quando non sa, tende a inventare.