Physical Address
304 North Cardinal St.
Dorchester Center, MA 02124
Physical Address
304 North Cardinal St.
Dorchester Center, MA 02124

Il 30 luglio Google DeepMind ha lanciato Gemini Robotics ER 2, un modello che fa da cervello di alto livello per robot e combina comprensione video, pianificazione multistep e collaborazione tra macchine diverse. Per Carolina Parada, responsabile della robotica di DeepMind, «è un’altra pietra miliare verso quella che chiamiamo AGI fisica: un robot che faccia tutto ciò che un essere umano può fare». L’annuncio segna un passo concreto nel portare l’intelligenza artificiale fuori dallo schermo e dentro magazzini, fabbriche e case.
Gemini Robotics ER 2 è un sistema di embodied reasoning che integra in un’unica architettura un modello visione-linguaggio (VLM) — capace di interpretare immagini e video e di dialogare con gli esseri umani — e due modelli visione-linguaggio-azione (VLA) per controllare il movimento del corpo e degli arti robotici. Il modello funziona da orchestratore: riceve un comando in linguaggio naturale, pianifica i passi necessari, chiama strumenti esterni come Google Search o API di navigazione, e affida l’esecuzione motoria ai VLA. Il tutto è disponibile via Gemini API, Google AI Studio e, in anteprima privata, sulla Gemini Enterprise Agent Platform.
La novità più concreta riguarda la capacità di monitorare l’avanzamento di un compito su flussi video continui. Gemini Robotics ER 2 classifica il completamento in intervalli di 0‑20 %, 20‑40 %, 40‑60 %, 60‑80 % e 80‑100 %, raggiungendo un’accuratezza del 57,4 % nella tracciatura. Sul fronte del moment‑finding — l’identificazione del fotogramma esatto in cui un’azione critica termina, per esempio quando smettere di versare caffè — il modello registra un’accuratezza del 91,3 % con una latenza media di 0,96 secondi, quattro volte più rapida dei modelli di categoria superiore. Queste prestazioni consentono al robot di correggersi in corsa, ripetere un passaggio fallito o passare al task successivo senza dover riavviare l’intera sequenza.

Gemini Robotics ER 2 abilita la collaborazione fra robot di tipo diverso, sfruttando una comprensione semantica condivisa. In una delle dimostrazioni, Apollo 2 di Apptronik (dotato di mani Sharpa) e un braccio Franka F3 Duo lavorano fianco a fianco per completare una mansione che nessuno dei due potrebbe svolgere da solo. Un’altra demo coinvolge Spot di Boston Dynamics — azienda con cui Google ha una partnership consolidata — che recupera uno snack a comando vocale, orchestrato direttamente da Gemini Robotics ER 2.
Avere modelli di frontiera che muovono robot in spazi condivisi con le persone alza la posta sulla sicurezza. «La questione è ancora più pressante perché li mettiamo in molte più situazioni. C’è molta incertezza, e per questo vogliamo comprendere il problema più a fondo», ha spiegato Parada a WIRED. Google DeepMind adotta un approccio a più livelli e introduce il benchmark ASIMOV‑Agentic, pensato per valutare se un sistema di orchestrazione multi‑modello rispetti vincoli di sicurezza fisica. Nei test, Gemini Robotics ER 2 arresta automaticamente un robot umanoide quando una persona si avvicina e riprende il lavoro solo quando l’area è sgombera, registrando miglioramenti significativi sugli indicatori Safety Instruction Following e Human Proximity rispetto alla versione precedente.
Mentre OpenAI e Anthropic dominano le cronache su chatbot e strumenti di coding, Google DeepMind sfrutta il proprio track record nella robotica per differenziarsi. L’accordo con Boston Dynamics — nato per fornire il “cervello” ai robot — e la visione dichiarata dal CEO Demis Hassabis (riportata da WIRED) di creare un sistema operativo per robot simile ad Android mostrano una strategia di lungo periodo: trasformare l’IA in un’infrastruttura fisica capace di rendere ogni macchina utile in ambienti reali. Gemini Robotics ER 2 è il primo tassello disponibile al pubblico di questa piattaforma.