Physical Address
304 North Cardinal St.
Dorchester Center, MA 02124
Physical Address
304 North Cardinal St.
Dorchester Center, MA 02124

Gemini-SQL2 traduce linguaggio naturale in query SQL eseguibili con un'accuratezza dell'80,04% sul benchmark BIRD, lasciando i concorrenti a oltre sette punti di distanza. GPT-5.5-xhigh di OpenAI si ferma al 72,8%, Claude Opus 4.6 di Anthropic al 70,9%; i modelli di Databricks, AWS, Tencent e Alibaba restano ancora più indietro. Google Research ha costruito il sistema su Gemini 3.1 Pro, senza ancora pubblicare un paper scientifico né annunciare una disponibilità pubblica.
Il BIRD è il riferimento standard per misurare con quale precisione un sistema converte domande in linguaggio naturale in query SQL eseguibili su database reali. La tabella riassume le posizioni di testa al 13 giugno 2026:
| Modello | Azienda | Accuratezza BIRD |
|---|---|---|
| Gemini-SQL2 | 80,04% | |
| GPT-5.5-xhigh | OpenAI | 72,8% |
| Claude Opus 4.6 | Anthropic | 70,9% |
Il vantaggio di Gemini-SQL2 su GPT-5.5-xhigh ammonta a 7,24 punti percentuali — equivalente, in termini relativi, a circa il 10% di query eseguite correttamente in più rispetto al secondo classificato. Su cento domande, Gemini-SQL2 ne traduce correttamente in SQL sette in più rispetto a GPT-5.5-xhigh, e oltre nove rispetto a Claude Opus 4.6.

Google Research sottolinea che la conversione da linguaggio naturale a SQL è complessa perché i dati aziendali sono spesso strutturati a strati e le query devono incorporare logiche di business articolate. Non è sufficiente che la sintassi sembri corretta: la query deve produrre i risultati attesi su database reali. Su questo doppio criterio — aspetto corretto ed esecuzione andata a buon fine — lavora il BIRD, che misura l'"execution accuracy" invece della semplice somiglianza testuale con una query di riferimento. È una distinzione rilevante: un SQL che genera il risultato giusto conta; uno esteticamente simile ma sbagliato nei risultati no.
Google Research non ha pubblicato alcun paper scientifico su Gemini-SQL2, e il team non ha comunicato se o quando il modello sarà accessibile esternamente. Quello di giugno 2026 è un annuncio di capacità tecnica, non il lancio di un prodotto. Google ha indicato che una migliore comprensione del SQL potrebbe rafforzare le funzionalità in linguaggio naturale nei suoi servizi dati in senso più ampio, senza però specificare prodotti o tempistiche.
Per chi lavora con database aziendali, il divario rispetto ai concorrenti è concreto. Ma finché Gemini-SQL2 resterà dentro i laboratori di ricerca, OpenAI e Anthropic avranno margine per rispondere. Il benchmark fissa il livello: circa 7-9 punti percentuali da recuperare.