Dispositivi smart AI a confronto su una superficie chiara, simbolo della sfida tra modelli linguistici di punta

Qwen3.8 Max aggancia Claude Opus 4.8, ma Kimi K3 costa il 25% in meno

Con 56 punti sull’Artificial Analysis Intelligence Index, Qwen3.8 Max raggiunge la parità con Claude Opus 4.8 e stacca GLM-5.2 (fermo a 51). Un balzo di 10 punti rispetto ai 46 di Qwen3.7 Max, che porta il modello di Alibaba nella top tier dei modelli linguistici. Il paradosso è che Kimi K3, con 57 punti, fa meglio e costa il 25 per cento in meno. Il risultato ridisegna la competizione: la corsa non è più solo a chi scrive meglio, ma a chi lo fa con il conto più leggero.

La parità ha un prezzo: il costo per task sale a 1,14 dollari

L’allineamento con Claude Opus 4.8 nasconde un’efficienza peggiorata. Secondo i dati raccolti da Artificial Analysis, un singolo task dell’Intelligence Index con Qwen3.8 Max costa 1,14 dollari, più del doppio rispetto agli 0,53 dollari della versione precedente. Kimi K3 ottiene un punto in più con soli 0,86 dollari a task, mentre GLM-5.2 scende a 0,57 dollari.

ModelloPunteggio AA Intelligence IndexCosto per task
Qwen3.8 Max56$1,14
Kimi K357$0,86
GLM-5.251$0,57
Qwen3.7 Max (precedente)46$0,53

I prezzi nominali sono scesi: input da 2,50 a 2,00 dollari per milione di token, output da 7,50 a 6,00 dollari, cache hit da 0,50 a 0,25 dollari. Ma l’aumento del numero di step necessari ha ribaltato il vantaggio. Qwen3.8 Max richiede 64 step per task invece dei 14 della versione 3.7, con un volume di token in ingresso moltiplicato per 15 perché il test reinvia l’intera cronologia della conversazione a ogni passaggio. Lavora in modo più approfondito, ma a un costo unitario che cancella la sforbiciata sui listini.

Dove vince davvero: il balzo di 468 Elo su GDPval-AA

Sul benchmark orientato al lavoro GDPval-AA, Qwen3.8 Max guadagna 468 punti Elo e arriva a 1.739, superando Kimi K3 (1.685) e piazzandosi dietro soltanto a Claude Opus 5 (1.852). Il modello eccelle nei compiti professionali, ma paga la complessità: per completare un task impiega 64 step contro i 14 della generazione precedente. Le imprese che valutano l’adozione devono mettere nel conto una latenza più alta e una fattura API che lievita.

Dispositivi smart AI a confronto su una superficie chiara, simbolo della sfida tra modelli linguistici di punta
Speaker smart a confronto per raccontare la sfida tra i modelli linguistici di punta: prestazioni simili, prezzi diversi.

Più potenza, più allucinazioni: i regressi

L’aumento di performance non è uniforme. AA-LCR, che misura la capacità di recuperare informazioni da testi molto lunghi, perde 2 punti. AA-Omniscience, che verifica se il modello risponde correttamente o ammette di non sapere, crolla di 10 punti. L’accuratezza rimane intorno al 31 per cento, ma il tasso di allucinazione sale dal 23 al 40 per cento. Qwen3.8 Max tende a indovinare molto più spesso invece di dichiarare ignoranza, un comportamento che può minare l’affidabilità in ambiti dove la precisione fattuale è critica.

Open weight e 2.400 miliardi di parametri: la vera novità

Al di là dei benchmark, Qwen3.8-Max segna un cambio di strategia. “Meet Qwen3.8-Max — our most capable model to date. Next week, the open weights of Qwen3.8-Max will be released”, ha annunciato su X l’account ufficiale di Qwen il 3 agosto 2026. È la prima volta che un modello della fascia Max viene distribuito come open weight. I numeri sono da laboratorio avanzato: 2.400 miliardi di parametri totali, di cui 95 miliardi attivati a ogni elaborazione.

Alibaba ha addestrato il modello per portare a termine attività lunghe giorni in modo autonomo: dalla scrittura di codice per oltre 16 giorni fino alla riproduzione e al miglioramento di esperimenti scientifici partendo da zero. L’annuncio dei pesi aperti sposta la competizione sul terreno dell’accessibilità: chiunque potrà eseguire localmente un modello con capacità da laboratorio, a patto di avere l’infrastruttura per gestirne la scala.

Il quadro complessivo è quello di un modello che ha raggiunto i migliori, ma con una ricetta costosa e alcune ombre sull’affidabilità. La mossa open weight è il vero elemento di rottura: abbassa le barriere e porta la potenza di calcolo nelle mani di sviluppatori e aziende. Resta da capire se la comunità saprà gestire un modello che, quando non sa, tende a inventare.

Fonti

Francesco Leone
Francesco Leone

Francesco Leone è un esperto in Intelligenza Artificiale con una profonda conoscenza in Machine Learning e Deep Learning. Attraverso la sua esperienza, ha contribuito allo sviluppo di soluzioni innovative in ambito di elaborazione del linguaggio naturale e visione artificiale, mirando a trasformare il modo in cui interagiamo con la tecnologia. Attivo nel settore con pubblicazioni e progetti su https://ital-ia.it/, Francesco si dedica alla ricerca e all'applicazione di algoritmi avanzati per rendere i sistemi più intelligenti e accessibili.

Articoli: 567

Lascia una risposta

Il tuo indirizzo email non sarà pubblicato. I campi obbligatori sono contrassegnati *