Smartphone e laptop su una superficie minimalista con rete neurale luminosa, intelligenza artificiale per agenti e coding

DeepSeek V4-Flash: agenti e coding migliorati, ora a un punto da GPT-5.6 Luna

Un balzo di 10 punti sull’Artificial Analysis Intelligence Index porta DeepSeek-V4-Flash-0731 a quota 50, a un solo punto da GPT-5.6 Luna di OpenAI. Il costo per task resta però inferiore del 60%, anche dopo il taglio dell’80% che OpenAI ha applicato al suo modello budget. La forbice prezzo-prestazioni, già ridotta, si assottiglia ancora.

Il salto negli agenti e nel coding

Il passo avanti più marcato riguarda i compiti agentici. Sul benchmark GDPval, che testa i modelli su complessi lavori d’ufficio del mondo reale, il nuovo Flash sale da 1.189 a 1.559 punti Elo. È un guadagno di 370 punti che segnala una ridotta propensione alle allucinazioni e una migliore capacità di portare a termine attività strutturate in autonomia.

L’Artificial Analysis Intelligence Index mostra progressi su ogni categoria valutata. Il modello consuma inoltre il 12% di token in meno rispetto alla versione di aprile 2026, un’efficienza che incide direttamente sui costi operativi.

Architettura identica, cache discount da record

Sotto il cofano non cambia nulla: 284 miliardi di parametri totali, 13 miliardi attivi e una finestra di contesto di un milione di token, con pesi disponibili sotto licenza MIT su Hugging Face.

Smartphone e laptop su una superficie minimalista con rete neurale luminosa, intelligenza artificiale per agenti e coding
Il nuovo modello punta su agenti più capaci e coding migliore, avvicinandosi ai vertici della classifica di settore.

Il vantaggio economico si gioca tutto sul cache discount del 98%, ben al di sopra dello standard di settore fermo al 90%. Per carichi di lavoro con prompt ripetitivi — assistenti virtuali, pipeline di automazione, revisioni di codice — il costo effettivo scende molto più del 60% dichiarato, perché la cache copre una fetta consistente dei token elaborati.

OpenAI aveva già portato GPT-5.6 Luna a 0,20 dollari per milione di token in input, ma la combinazione di cache aggressiva e minor consumo di token rende DeepSeek-V4-Flash-0731 il modello con il miglior rapporto qualità-prezzo oggi disponibile.

Perché il divario si misura in centesimi

Mettendo in fila i numeri: 50 punti indice contro 51, 1.559 Elo in GDPval, efficienza token migliorata del 12%. La distanza qualitativa da GPT-5.6 Luna è ormai di un punto su scala Artificial Analysis. La differenza reale, per chi sviluppa o integra modelli in produzione, si gioca sul costo operativo.

Il pattern è chiaro: DeepSeek sta colmando il gap con i modelli di fascia alta non solo sul piano delle performance, ma sul costo per attività complessa. Per le aziende che costruiscono applicazioni agentiche, il nuovo Flash non è un semplice aggiornamento: è la prova che la competizione si è spostata tutta sul piano del prezzo, e che il margine di OpenAI si è ridotto a pochi centesimi per task.

Fonti

Francesco Leone
Francesco Leone

Francesco Leone è un esperto in Intelligenza Artificiale con una profonda conoscenza in Machine Learning e Deep Learning. Attraverso la sua esperienza, ha contribuito allo sviluppo di soluzioni innovative in ambito di elaborazione del linguaggio naturale e visione artificiale, mirando a trasformare il modo in cui interagiamo con la tecnologia. Attivo nel settore con pubblicazioni e progetti su https://ital-ia.it/, Francesco si dedica alla ricerca e all'applicazione di algoritmi avanzati per rendere i sistemi più intelligenti e accessibili.

Articoli: 563

Lascia una risposta

Il tuo indirizzo email non sarà pubblicato. I campi obbligatori sono contrassegnati *