Physical Address
304 North Cardinal St.
Dorchester Center, MA 02124
Physical Address
304 North Cardinal St.
Dorchester Center, MA 02124

Fino al 24 giugno 2026, controllare un computer con un agente AI richiedeva un modello dedicato e separato. Con l'integrazione di Computer Use in Gemini 3.5 Flash, Google DeepMind elimina quella separazione: il controllo visivo di schermi, browser e dispositivi mobili diventa una funzione nativa dello stesso modello già usato per ricerca, mappe e chiamate di funzione. Sul benchmark OSWorld, Gemini 3.5 Flash segna 78.4 punti, superando la versione precedente di 13.3 punti.
Il Gemini 2.5 computer use era un modello standalone dedicato: forniva il controllo visivo ma operava separato dagli altri strumenti di Gemini. Con il rilascio del 24 giugno, Google DeepMind integra quella stessa capacità direttamente in Gemini 3.5 Flash, affiancandola a function calling, grounding su Search e Maps. Il risultato è un'architettura agente più compatta: uno sviluppatore non orchestra più modelli distinti, ma ottiene controllo visivo e strumenti generativi da un unico punto.
Tra i casi d'uso dimostrati da Google DeepMind figurano l'analisi dell'app Gemini per restituire un elenco categorizzato di funzionalità e l'audit automatico della documentazione per l'accessibilità. Gli scenari enterprise dichiarati includono test continuo del software e automazione di knowledge work su applicazioni professionali.
La funzionalità è disponibile subito tramite la Gemini API e la Gemini Enterprise Agent Platform, con una demo ospitata da Browserbase e un'implementazione di riferimento su GitHub.
OSWorld è il benchmark di riferimento per misurare la capacità dei modelli di interagire con interfacce grafiche reali: file manager, browser, applicazioni da ufficio. Gemini 3.5 Flash ottiene 78.4 punti, contro i 65.1 di Gemini 3 Flash — un incremento di 13.3 punti sulla stessa linea di modelli.

| Modello | Punteggio OSWorld |
|---|---|
| Anthropic Opus 4.8 | 83.4 |
| GPT-5.5 | 78.7 |
| Gemini 3.5 Flash | 78.4 |
| Sonnet 4.6 | 78.4 |
| Gemini 3.1 Pro | 76.2 |
| GPT-5.4 mini | 72.1 |
| Gemini 3 Flash | 65.1 |
Gemini 3.5 Flash è a pari merito con Sonnet 4.6 di Anthropic e supera GPT-5.4 mini di 6.3 punti. Il distacco da GPT-5.5 è di soli 0.3 punti. Opus 4.8 di Anthropic guida la classifica con 83.4, a 5 punti da Gemini 3.5 Flash.
Un agente che controlla schermi e browser affronta un rischio specifico: il prompt injection indiretto, ovvero contenuti malevoli presenti in una pagina o documento che tentano di dirottare il comportamento del modello. Google ha risposto con addestramento avversariale mirato e due salvaguardie enterprise opzionali:
Google raccomanda di abbinare queste misure a sandboxing, supervisione umana e controlli di accesso restrittivi, seguendo un approccio a difesa su più livelli.
Il punteggio di 78.4 è competitivo, ma il cambiamento più rilevante è strutturale. Integrare Computer Use nel modello Flash principale — invece di mantenerlo come prodotto separato — riduce la complessità di deploy per chi costruisce agenti aziendali. Combinare controllo visivo, ricerca e chiamate di funzione in un unico modello abbassa la soglia tecnica per automazioni che richiedevano orchestrazione multi-modello.
Il distacco di 5 punti rispetto a Opus 4.8 (83.4 contro 78.4) indica che Anthropic conserva un vantaggio misurabile sull'automazione visiva più complessa. Per scenari standard — test del software, navigazione di applicazioni professionali — Gemini 3.5 Flash entra come opzione diretta in un segmento che, fino a giugno 2026, era appannaggio esclusivo dei modelli di fascia superiore.