Google DeepMind presenta Gemini Robotics ER 2: robot collaborativi con comprensione video

Gemini Robotics ER 2: robot Google DeepMind che vedono e collaborano

Il 30 luglio Google DeepMind ha lanciato Gemini Robotics ER 2, un modello che fa da cervello di alto livello per robot e combina comprensione video, pianificazione multistep e collaborazione tra macchine diverse. Per Carolina Parada, responsabile della robotica di DeepMind, «è un’altra pietra miliare verso quella che chiamiamo AGI fisica: un robot che faccia tutto ciò che un essere umano può fare». L’annuncio segna un passo concreto nel portare l’intelligenza artificiale fuori dallo schermo e dentro magazzini, fabbriche e case.

Un modello di ragionamento incarnato per coordinare i movimenti

Gemini Robotics ER 2 è un sistema di embodied reasoning che integra in un’unica architettura un modello visione-linguaggio (VLM) — capace di interpretare immagini e video e di dialogare con gli esseri umani — e due modelli visione-linguaggio-azione (VLA) per controllare il movimento del corpo e degli arti robotici. Il modello funziona da orchestratore: riceve un comando in linguaggio naturale, pianifica i passi necessari, chiama strumenti esterni come Google Search o API di navigazione, e affida l’esecuzione motoria ai VLA. Il tutto è disponibile via Gemini API, Google AI Studio e, in anteprima privata, sulla Gemini Enterprise Agent Platform.

Progressi temporali: i robot ora tracciano il proprio lavoro e si correggono

La novità più concreta riguarda la capacità di monitorare l’avanzamento di un compito su flussi video continui. Gemini Robotics ER 2 classifica il completamento in intervalli di 0‑20 %, 20‑40 %, 40‑60 %, 60‑80 % e 80‑100 %, raggiungendo un’accuratezza del 57,4 % nella tracciatura. Sul fronte del moment‑finding — l’identificazione del fotogramma esatto in cui un’azione critica termina, per esempio quando smettere di versare caffè — il modello registra un’accuratezza del 91,3 % con una latenza media di 0,96 secondi, quattro volte più rapida dei modelli di categoria superiore. Queste prestazioni consentono al robot di correggersi in corsa, ripetere un passaggio fallito o passare al task successivo senza dover riavviare l’intera sequenza.

Google DeepMind presenta Gemini Robotics ER 2: robot collaborativi con comprensione video
Braccio robotico in un ambiente di manifattura moderna. Foto di Freek Wolsink su Pexels

Collaborazione multi‑robot: Apollo 2 e Franka F3 Duo all’opera

Gemini Robotics ER 2 abilita la collaborazione fra robot di tipo diverso, sfruttando una comprensione semantica condivisa. In una delle dimostrazioni, Apollo 2 di Apptronik (dotato di mani Sharpa) e un braccio Franka F3 Duo lavorano fianco a fianco per completare una mansione che nessuno dei due potrebbe svolgere da solo. Un’altra demo coinvolge Spot di Boston Dynamics — azienda con cui Google ha una partnership consolidata — che recupera uno snack a comando vocale, orchestrato direttamente da Gemini Robotics ER 2.

La sfida sicurezza: il benchmark ASIMOV‑Agentic e il freno automatico

Avere modelli di frontiera che muovono robot in spazi condivisi con le persone alza la posta sulla sicurezza. «La questione è ancora più pressante perché li mettiamo in molte più situazioni. C’è molta incertezza, e per questo vogliamo comprendere il problema più a fondo», ha spiegato Parada a WIRED. Google DeepMind adotta un approccio a più livelli e introduce il benchmark ASIMOV‑Agentic, pensato per valutare se un sistema di orchestrazione multi‑modello rispetti vincoli di sicurezza fisica. Nei test, Gemini Robotics ER 2 arresta automaticamente un robot umanoide quando una persona si avvicina e riprende il lavoro solo quando l’area è sgombera, registrando miglioramenti significativi sugli indicatori Safety Instruction Following e Human Proximity rispetto alla versione precedente.

Perché Google sta puntando tutto sull’AGI fisica

Mentre OpenAI e Anthropic dominano le cronache su chatbot e strumenti di coding, Google DeepMind sfrutta il proprio track record nella robotica per differenziarsi. L’accordo con Boston Dynamics — nato per fornire il “cervello” ai robot — e la visione dichiarata dal CEO Demis Hassabis (riportata da WIRED) di creare un sistema operativo per robot simile ad Android mostrano una strategia di lungo periodo: trasformare l’IA in un’infrastruttura fisica capace di rendere ogni macchina utile in ambienti reali. Gemini Robotics ER 2 è il primo tassello disponibile al pubblico di questa piattaforma.

Francesco Leone
Francesco Leone

Francesco Leone è un esperto in Intelligenza Artificiale con una profonda conoscenza in Machine Learning e Deep Learning. Attraverso la sua esperienza, ha contribuito allo sviluppo di soluzioni innovative in ambito di elaborazione del linguaggio naturale e visione artificiale, mirando a trasformare il modo in cui interagiamo con la tecnologia. Attivo nel settore con pubblicazioni e progetti su https://ital-ia.it/, Francesco si dedica alla ricerca e all'applicazione di algoritmi avanzati per rendere i sistemi più intelligenti e accessibili.

Articoli: 567

Lascia una risposta

Il tuo indirizzo email non sarà pubblicato. I campi obbligatori sono contrassegnati *