Google integra Computer Use in Gemini 3.5 Flash per controllo autonomo di schermi e browser

Gemini 3.5 Flash: Computer Use nativo e 78.4 su OSWorld

Fino al 24 giugno 2026, controllare un computer con un agente AI richiedeva un modello dedicato e separato. Con l'integrazione di Computer Use in Gemini 3.5 Flash, Google DeepMind elimina quella separazione: il controllo visivo di schermi, browser e dispositivi mobili diventa una funzione nativa dello stesso modello già usato per ricerca, mappe e chiamate di funzione. Sul benchmark OSWorld, Gemini 3.5 Flash segna 78.4 punti, superando la versione precedente di 13.3 punti.

Da modello standalone a funzione integrata

Il Gemini 2.5 computer use era un modello standalone dedicato: forniva il controllo visivo ma operava separato dagli altri strumenti di Gemini. Con il rilascio del 24 giugno, Google DeepMind integra quella stessa capacità direttamente in Gemini 3.5 Flash, affiancandola a function calling, grounding su Search e Maps. Il risultato è un'architettura agente più compatta: uno sviluppatore non orchestra più modelli distinti, ma ottiene controllo visivo e strumenti generativi da un unico punto.

Tra i casi d'uso dimostrati da Google DeepMind figurano l'analisi dell'app Gemini per restituire un elenco categorizzato di funzionalità e l'audit automatico della documentazione per l'accessibilità. Gli scenari enterprise dichiarati includono test continuo del software e automazione di knowledge work su applicazioni professionali.

La funzionalità è disponibile subito tramite la Gemini API e la Gemini Enterprise Agent Platform, con una demo ospitata da Browserbase e un'implementazione di riferimento su GitHub.

OSWorld: Gemini 3.5 Flash raggiunge Sonnet 4.6 e supera GPT-5.4 mini

OSWorld è il benchmark di riferimento per misurare la capacità dei modelli di interagire con interfacce grafiche reali: file manager, browser, applicazioni da ufficio. Gemini 3.5 Flash ottiene 78.4 punti, contro i 65.1 di Gemini 3 Flash — un incremento di 13.3 punti sulla stessa linea di modelli.

Google integra Computer Use in Gemini 3.5 Flash per controllo autonomo di schermi e browser
Mano robotica aziona i tasti di una tastiera nera in setting minimalista. Foto di Tara Winstead su Pexels
ModelloPunteggio OSWorld
Anthropic Opus 4.883.4
GPT-5.578.7
Gemini 3.5 Flash78.4
Sonnet 4.678.4
Gemini 3.1 Pro76.2
GPT-5.4 mini72.1
Gemini 3 Flash65.1

Gemini 3.5 Flash è a pari merito con Sonnet 4.6 di Anthropic e supera GPT-5.4 mini di 6.3 punti. Il distacco da GPT-5.5 è di soli 0.3 punti. Opus 4.8 di Anthropic guida la classifica con 83.4, a 5 punti da Gemini 3.5 Flash.

Sicurezza: addestramento avversariale e due salvaguardie opzionali

Un agente che controlla schermi e browser affronta un rischio specifico: il prompt injection indiretto, ovvero contenuti malevoli presenti in una pagina o documento che tentano di dirottare il comportamento del modello. Google ha risposto con addestramento avversariale mirato e due salvaguardie enterprise opzionali:

  • Conferma esplicita dell'utente per azioni sensibili o irreversibili
  • Interruzione automatica del task al rilevamento di un prompt injection indiretto

Google raccomanda di abbinare queste misure a sandboxing, supervisione umana e controlli di accesso restrittivi, seguendo un approccio a difesa su più livelli.

L'integrazione cambia l'architettura, non solo il benchmark

Il punteggio di 78.4 è competitivo, ma il cambiamento più rilevante è strutturale. Integrare Computer Use nel modello Flash principale — invece di mantenerlo come prodotto separato — riduce la complessità di deploy per chi costruisce agenti aziendali. Combinare controllo visivo, ricerca e chiamate di funzione in un unico modello abbassa la soglia tecnica per automazioni che richiedevano orchestrazione multi-modello.

Il distacco di 5 punti rispetto a Opus 4.8 (83.4 contro 78.4) indica che Anthropic conserva un vantaggio misurabile sull'automazione visiva più complessa. Per scenari standard — test del software, navigazione di applicazioni professionali — Gemini 3.5 Flash entra come opzione diretta in un segmento che, fino a giugno 2026, era appannaggio esclusivo dei modelli di fascia superiore.

Fonti

Francesco Leone
Francesco Leone

Francesco Leone è un esperto in Intelligenza Artificiale con una profonda conoscenza in Machine Learning e Deep Learning. Attraverso la sua esperienza, ha contribuito allo sviluppo di soluzioni innovative in ambito di elaborazione del linguaggio naturale e visione artificiale, mirando a trasformare il modo in cui interagiamo con la tecnologia. Attivo nel settore con pubblicazioni e progetti su https://ital-ia.it/, Francesco si dedica alla ricerca e all'applicazione di algoritmi avanzati per rendere i sistemi più intelligenti e accessibili.

Articoli: 562

Lascia una risposta

Il tuo indirizzo email non sarà pubblicato. I campi obbligatori sono contrassegnati *