Google DeepMind ripensa il cursore del mouse nell'era dell'AI

Pointer Engineering: DeepMind ridisegna il cursore con Gemini

Il mouse non è cambiato nella sostanza per oltre cinquant'anni di informatica personale: traccia la posizione, registra clic e rileva hover. Il 13 maggio 2026 Google DeepMind ha presentato un sistema sperimentale che cambia questa premessa. Si chiama Pointer Engineering ed è un puntatore alimentato da Gemini che non si limita a localizzare dove si sta puntando: comprende il contenuto, ne estrae il significato e lo consegna al modello come contesto. Senza prompt manuali, senza cambiare finestra.

Il problema: ogni sessione AI è un'interruzione del flusso

Chiunque abbia usato un assistente AI mentre lavorava in un documento o in un browser conosce la sequenza. Si individua qualcosa di interessante, si passa alla finestra di chat, si riscrive a parole quello che si stava guardando, si ottiene la risposta, si torna indietro. Ogni volta da capo, ogni volta con attrito.

I ricercatori Adrien Baranes e Rob Marchant di Google DeepMind lo sintetizzano con precisione: "Poiché un tipico strumento AI vive nella propria finestra, gli utenti devono portare il proprio mondo all'interno di esso. Noi vogliamo il contrario." Il gap tecnico è concreto: le interfacce LLM attuali sono prevalentemente testo-in, testo-fuori. Non hanno consapevolezza dello stato dello schermo attorno a loro. L'AI-enabled pointer prova a colmare questo gap fornendo al modello contesto visivo e semantico in tempo reale — derivato dalla posizione del cursore e dallo stato di hover — senza chiedere all'utente di serializzare nulla in forma scritta.

I quattro principi del Pointer Engineering

DeepMind ha strutturato il sistema attorno a quattro principi di interazione:

  • Maintain the flow — Le funzionalità AI sono disponibili in qualsiasi applicazione, senza forzare "deviazioni AI" verso interfacce separate. L'utente può puntare a un PDF e richiedere un riassunto da incollare direttamente in una email, o evidenziare una ricetta e chiedere le dosi doppiate, senza mai uscire dall'app in uso.
  • Show and tell — Il cursore cattura visivamente il contesto attorno all'area hover e lo tratta come input strutturato per il modello — una regione visiva ritagliata e contestualizzata in tempo reale, analoga a come i modelli multimodali elaborano immagine e testo insieme. Basta puntare: il sistema sa già quale parola, paragrafo o blocco di codice è rilevante.
  • Embrace the power of "This" and "That" — Frasi come "sistema questo", "sposta quello lì" o "cosa significa?" sono il linguaggio deittico che gli esseri umani usano naturalmente quando possono indicare fisicamente qualcosa. Il sistema gestisce esattamente questa classe di istruzioni senza richiedere all'utente di esplicitare il referente.
  • Turn pixels into actionable entities — Il principio tecnicamente più sostanziale: il puntatore esegue un'estrazione di entità in tempo reale sul contenuto visivo sotto il cursore, convertendo regioni di pixel grezzi in oggetti tipizzati e azionabili. Un appunto scritto a mano diventa una to-do list interattiva; un frame fermo di un video di viaggio diventa un link di prenotazione per il ristorante inquadrato.

Demo live, Chrome e Googlebook: dove arriva oggi

Due demo sono disponibili da oggi in Google AI Studio: una per l'editing di immagini e una per la ricerca di luoghi su mappa, entrambe attivabili con il puntatore e con la voce. L'integrazione più profonda, chiamata Magic Pointer, è in rollout su Gemini in Chrome: gli utenti possono selezionare elementi di una pagina web e interrogare il modello senza costruire alcun prompt — confrontando prodotti, o indicando dove vorrebbero visualizzare un mobile nel proprio salotto.

Google DeepMind ripensa il cursore del mouse nell'era dell'AI
Mouse ergonomico su scrivania da ufficio, simbolo dell'interfaccia fisica che l'intelligenza artificiale sta ridisegnando. Foto di Josh Sorenson su Pexels

Un'ulteriore integrazione è pianificata per Googlebook, la nuova linea di laptop alimentati da Gemini annunciata da Google la stessa settimana. Su quella piattaforma Magic Pointer farà parte dell'esperienza di sistema, non di un'applicazione separata.

Il sistema non intende sostituire il prompt engineering per task complessi. Frasi brevi e deitiche funzionano bene; operazioni articolate richiedono ancora descrizioni precise. L'obiettivo dichiarato è circoscritto: ridurre l'attrito nelle interazioni quotidiane brevi, quelle in cui il contesto è visivamente ovvio ma costoso da trasferire in testo.

Perché il "pointer layer" diventa una posizione strategica

Il cursore è l'interfaccia più universale dell'informatica personale. Nessuno lo ha mai imparato: è semplicemente lì. Portare l'intelligenza di un modello direttamente a quel livello — invece di costruire un'applicazione AI separata — sposta il punto di contatto tra utente e AI dall'app alla superficie stessa del sistema operativo. Non un assistente a cui si delega un compito: un layer cognitivo che segue il puntatore in ogni applicazione già in uso.

Chi controlla il pointer layer controlla uno snodo critico dell'esperienza utente. Google sta integrando Pointer Engineering nel browser e nell'hardware simultaneamente — due posizioni difficili da replicare per i competitor che operano esclusivamente a livello software. La logica competitiva è chiara: rendere Gemini presente ovunque senza che l'utente debba mai sceglierlo attivamente.

Il test reale non sarà la qualità delle demo in AI Studio. Sarà la tenuta del sistema su superfici eterogenee — documenti aziendali, codice, interfacce di terze parti — dove il contenuto visivo è molto meno strutturato di una pagina web ottimizzata per il rendering.

Francesco Leone
Francesco Leone

Francesco Leone è un esperto in Intelligenza Artificiale con una profonda conoscenza in Machine Learning e Deep Learning. Attraverso la sua esperienza, ha contribuito allo sviluppo di soluzioni innovative in ambito di elaborazione del linguaggio naturale e visione artificiale, mirando a trasformare il modo in cui interagiamo con la tecnologia. Attivo nel settore con pubblicazioni e progetti su https://ital-ia.it/, Francesco si dedica alla ricerca e all'applicazione di algoritmi avanzati per rendere i sistemi più intelligenti e accessibili.

Articoli: 553

Lascia una risposta

Il tuo indirizzo email non sarà pubblicato. I campi obbligatori sono contrassegnati *