Google annuncia Gemini-SQL2: text-to-SQL con 80% di accuratezza benchmark

Gemini-SQL2: Google supera OpenAI e Anthropic nel text-to-SQL

Gemini-SQL2 traduce linguaggio naturale in query SQL eseguibili con un'accuratezza dell'80,04% sul benchmark BIRD, lasciando i concorrenti a oltre sette punti di distanza. GPT-5.5-xhigh di OpenAI si ferma al 72,8%, Claude Opus 4.6 di Anthropic al 70,9%; i modelli di Databricks, AWS, Tencent e Alibaba restano ancora più indietro. Google Research ha costruito il sistema su Gemini 3.1 Pro, senza ancora pubblicare un paper scientifico né annunciare una disponibilità pubblica.

Gemini-SQL2 primo nel ranking BIRD con 80,04%

Il BIRD è il riferimento standard per misurare con quale precisione un sistema converte domande in linguaggio naturale in query SQL eseguibili su database reali. La tabella riassume le posizioni di testa al 13 giugno 2026:

ModelloAziendaAccuratezza BIRD
Gemini-SQL2Google80,04%
GPT-5.5-xhighOpenAI72,8%
Claude Opus 4.6Anthropic70,9%

Il vantaggio di Gemini-SQL2 su GPT-5.5-xhigh ammonta a 7,24 punti percentuali — equivalente, in termini relativi, a circa il 10% di query eseguite correttamente in più rispetto al secondo classificato. Su cento domande, Gemini-SQL2 ne traduce correttamente in SQL sette in più rispetto a GPT-5.5-xhigh, e oltre nove rispetto a Claude Opus 4.6.

Google annuncia Gemini-SQL2: text-to-SQL con 80% di accuratezza benchmark
Persona che lavora su un moderno netbook in una stanza scura. Foto di Sora Shimazaki su Pexels

Perché generare SQL corretto è insidioso

Google Research sottolinea che la conversione da linguaggio naturale a SQL è complessa perché i dati aziendali sono spesso strutturati a strati e le query devono incorporare logiche di business articolate. Non è sufficiente che la sintassi sembri corretta: la query deve produrre i risultati attesi su database reali. Su questo doppio criterio — aspetto corretto ed esecuzione andata a buon fine — lavora il BIRD, che misura l'"execution accuracy" invece della semplice somiglianza testuale con una query di riferimento. È una distinzione rilevante: un SQL che genera il risultato giusto conta; uno esteticamente simile ma sbagliato nei risultati no.

Ricerca senza paper e senza release pubblica

Google Research non ha pubblicato alcun paper scientifico su Gemini-SQL2, e il team non ha comunicato se o quando il modello sarà accessibile esternamente. Quello di giugno 2026 è un annuncio di capacità tecnica, non il lancio di un prodotto. Google ha indicato che una migliore comprensione del SQL potrebbe rafforzare le funzionalità in linguaggio naturale nei suoi servizi dati in senso più ampio, senza però specificare prodotti o tempistiche.

Per chi lavora con database aziendali, il divario rispetto ai concorrenti è concreto. Ma finché Gemini-SQL2 resterà dentro i laboratori di ricerca, OpenAI e Anthropic avranno margine per rispondere. Il benchmark fissa il livello: circa 7-9 punti percentuali da recuperare.

Fonti

Francesco Leone
Francesco Leone

Francesco Leone è un esperto in Intelligenza Artificiale con una profonda conoscenza in Machine Learning e Deep Learning. Attraverso la sua esperienza, ha contribuito allo sviluppo di soluzioni innovative in ambito di elaborazione del linguaggio naturale e visione artificiale, mirando a trasformare il modo in cui interagiamo con la tecnologia. Attivo nel settore con pubblicazioni e progetti su https://ital-ia.it/, Francesco si dedica alla ricerca e all'applicazione di algoritmi avanzati per rendere i sistemi più intelligenti e accessibili.

Articoli: 567

Lascia una risposta

Il tuo indirizzo email non sarà pubblicato. I campi obbligatori sono contrassegnati *