Physical Address
304 North Cardinal St.
Dorchester Center, MA 02124
Physical Address
304 North Cardinal St.
Dorchester Center, MA 02124

Alibaba entra nell'arena dei modelli di frontiera con Qwen3.8-Max, un sistema da 2,4 trilioni di parametri che non si limita a rispondere a prompt singoli: completa task complessi in autonomia per giorni. La scommessa del colosso cinese è chiara — contendere la leadership a OpenAI e Anthropic spostando il confronto dal singolo benchmark alla capacità di portare a termine progetti reali senza supervisione umana, dalla riproduzione di paper scientifici alla progettazione di chip.
Il modello sarà rilasciato con pesi aperti la prossima settimana su Hugging Face e ModelScope, una mossa che lo distingue dai rivali occidentali closed-source e lo posiziona direttamente contro il Kimi K3 di Moonshot AI, lanciato a luglio 2026 con 2,8 trilioni di parametri.
Per dimostrare le capacità del modello, il team Qwen ha documentato tre casi di studio in ambito coding, tutti portati a termine senza alcun intervento umano. Il primo è un progetto software completo: in 16 giorni Qwen3.8-Max ha costruito da zero il tool a riga di comando oh-my-cli, generando 265 commit, 127 pull request e 151 issue su GitHub, gestendo l'intero ciclo — dalla raccolta delle richieste utente alla scrittura del codice, fino al testing iterativo.
Il secondo test ha riguardato la riproduzione del paper accademico "Unified Data Selection for LLM Reasoning". Senza codice di partenza, il modello ha impiegato circa 125 ore di calcolo, scritto 7.600 righe di codice e lanciato 33 job di training su GPU. Dopo aver replicato tutti e sei i risultati principali dello studio, ha testato 18 idee proprie in quattro round, superando il metodo originale di 2,7 punti sul benchmark matematico AIME24.
Il terzo caso ha messo Qwen3.8-Max in competizione con 526 team umani nella WWW2025 Multimodal Dialogue Intent Recognition Challenge. In 24 ore e con 45 submission, il modello ha portato l'accuratezza da 0,60 a 0,853, piazzandosi davanti a 458 team su 526.
Due ulteriori esperimenti hanno spinto il modello su task che richiedono centinaia di round di interazione e pianificazione a lungo termine. Nel primo, Qwen3.8-Max ha ricevuto l'incarico di progettare un blocco crittografico per schemi di cifratura, con l'obiettivo di minimizzare il numero di porte logiche. Partito da un design funzionante ma inefficiente con 8.298 porte, il modello ha ridotto il circuito a 678 porte in circa 500 iterazioni, ottenendo una riduzione dell'81% dell'area fisica del chip (da 106×106 a 46×46 micrometri) dopo il layout automatico con OpenROAD.

Nel secondo test — E-Commerce-Bench, una simulazione di un intero anno fiscale basata su dati anonimizzati di Taobao e Tmall — il modello ha gestito più negozi online in parallelo partendo da 100.000 yuan di capitale. Ha negoziato con fornitori in linguaggio naturale, modificato prezzi, gestito resi e affrontato crisi come tifoni o interruzioni della supply chain, individuando anche 152 truffatori nascosti tra i fornitori. Il bilancio finale: 416.252 yuan, un rendimento che quadruplica il capitale iniziale e supera del 38% il secondo classificato GLM 5.2, con un utile netto di oltre 100.000 yuan durante le festività.
Qwen3.8-Max adotta un'architettura Mixture-of-Experts (MoE): dei 2,4 trilioni di parametri totali, solo 95 miliardi vengono attivati per ogni query. Questo design riduce i costi di calcolo e migliora la velocità di risposta, rendendo il modello più pratico per implementazioni commerciali. Supporta finestre di contesto fino a un milione di token ed elabora documenti con oltre 200 pagine e video di più di 100 ore.
Sulle classifiche, Alibaba riporta risultati competitivi con Claude Opus 4.8, Claude Fable 5 e GPT-5.6 Sol. Su PaperBench ottiene 93, il punteggio più alto nel confronto; su TerminalBench 2.1 segna 86,6, dietro a GPT-5.6 Sol (88,8). Su Arena.AI il modello è diventato immediatamente il sistema cinese meglio classificato per la generazione di testo e secondo a livello globale nei compiti multimodali, dietro una variante di Claude Fable 5.
Le azioni Alibaba sono salite di oltre il 6% a Hong Kong il 3 agosto 2026. Il mercato legge il lancio come un segnale di esecuzione concreta sulla strategia AI, dopo che a maggio 2026 l'azienda ha dichiarato di voler ampliare i suoi investimenti in infrastrutture AI fino a 380 miliardi di yuan (circa 56 miliardi di dollari) nell'arco di tre anni. Qwen3.8-Max sarà disponibile tramite Model Studio di Alibaba Cloud, rivolgendosi direttamente agli sviluppatori aziendali.
I benchmark autodichiarati attendono verifica indipendente, e il rivale domestico Moonshot AI ha già mostrato con Kimi K3 come i numeri sui parametri non sempre si traducano in superiorità netta nei test di terze parti. Ma il dato che distingue Qwen3.8-Max è la documentazione dettagliata di task multi-giorno portati a termine senza supervisione: un tipo di evidenza che finora nessun laboratorio occidentale aveva messo sul tavolo con questo livello di trasparenza.
Il vero banco di prova non sarà il singolo benchmark, ma se il modello riuscirà a replicare queste prestazioni in ambienti aziendali reali, dove la distanza tra un test controllato e un processo produttivo può essere ampia.