Physical Address
304 North Cardinal St.
Dorchester Center, MA 02124
Physical Address
304 North Cardinal St.
Dorchester Center, MA 02124

Un balzo di 10 punti sull’Artificial Analysis Intelligence Index porta DeepSeek-V4-Flash-0731 a quota 50, a un solo punto da GPT-5.6 Luna di OpenAI. Il costo per task resta però inferiore del 60%, anche dopo il taglio dell’80% che OpenAI ha applicato al suo modello budget. La forbice prezzo-prestazioni, già ridotta, si assottiglia ancora.
Il passo avanti più marcato riguarda i compiti agentici. Sul benchmark GDPval, che testa i modelli su complessi lavori d’ufficio del mondo reale, il nuovo Flash sale da 1.189 a 1.559 punti Elo. È un guadagno di 370 punti che segnala una ridotta propensione alle allucinazioni e una migliore capacità di portare a termine attività strutturate in autonomia.
L’Artificial Analysis Intelligence Index mostra progressi su ogni categoria valutata. Il modello consuma inoltre il 12% di token in meno rispetto alla versione di aprile 2026, un’efficienza che incide direttamente sui costi operativi.
Sotto il cofano non cambia nulla: 284 miliardi di parametri totali, 13 miliardi attivi e una finestra di contesto di un milione di token, con pesi disponibili sotto licenza MIT su Hugging Face.

Il vantaggio economico si gioca tutto sul cache discount del 98%, ben al di sopra dello standard di settore fermo al 90%. Per carichi di lavoro con prompt ripetitivi — assistenti virtuali, pipeline di automazione, revisioni di codice — il costo effettivo scende molto più del 60% dichiarato, perché la cache copre una fetta consistente dei token elaborati.
OpenAI aveva già portato GPT-5.6 Luna a 0,20 dollari per milione di token in input, ma la combinazione di cache aggressiva e minor consumo di token rende DeepSeek-V4-Flash-0731 il modello con il miglior rapporto qualità-prezzo oggi disponibile.
Mettendo in fila i numeri: 50 punti indice contro 51, 1.559 Elo in GDPval, efficienza token migliorata del 12%. La distanza qualitativa da GPT-5.6 Luna è ormai di un punto su scala Artificial Analysis. La differenza reale, per chi sviluppa o integra modelli in produzione, si gioca sul costo operativo.
Il pattern è chiaro: DeepSeek sta colmando il gap con i modelli di fascia alta non solo sul piano delle performance, ma sul costo per attività complessa. Per le aziende che costruiscono applicazioni agentiche, il nuovo Flash non è un semplice aggiornamento: è la prova che la competizione si è spostata tutta sul piano del prezzo, e che il margine di OpenAI si è ridotto a pochi centesimi per task.