Physical Address
304 North Cardinal St.
Dorchester Center, MA 02124
Physical Address
304 North Cardinal St.
Dorchester Center, MA 02124

Quando un sistema IA autonomo potrebbe agire contro gli obiettivi di chi lo ha creato, fidarsi del suo allineamento non basta. Google DeepMind ha pubblicato il 18 giugno 2026 l'"AI Control Roadmap" (v0.1), un framework di sicurezza che tratta gli agenti IA come potenziali minacce insider — impiegati con le chiavi dell'ufficio che potrebbero, in linea di principio, lavorare contro l'azienda. La premessa è deliberata: l'allineamento AI potrebbe non funzionare sempre, e serve un piano costruito esplicitamente per il caso peggiore.
Il framework si appoggia al MITRE ATT&CK, lo strumento di cybersecurity che scompone gli attacchi in tattiche e tecniche tracciabili singolarmente. L'analogia operativa è quella dell'istruttore di guida con i doppi comandi: si fida dell'allievo, ma tiene una mano vicino al volante. Gli agenti ottengono permessi in modo graduale, sulla base di comportamenti verificati — non di assunzioni di buona fede.
A fare da guardia sono agenti IA "supervisori" fidati, che monitorano il ragionamento e le azioni di quelli attivi. Un modulo di prevenzione può bloccare interventi dannosi prima che avvengano. Le metriche tengono traccia di quante sessioni vengono osservate, quante anomalie intercettate e in quanto tempo.
La roadmap articola quattro livelli di rilevamento (D1–D4) e tre livelli di risposta (R1–R3), calibrati sulle capacità misurabili dei modelli. Le azioni reversibili e a basso rischio si possono revisionare a posteriori sui log; quelle ad alto rischio — un attacco informatico grave, ad esempio — richiedono blocco in tempo reale.

DeepMind segnala due rischi evolutivi che possono rendere obsoleto il monitoraggio: l'"oversight awareness" (il modello capisce di essere osservato e adatta il comportamento) e il "ragionamento opaco" (ragiona senza produrre testo visibile). In entrambi i casi diventerebbe necessaria l'analisi degli interni del modello — un livello di supervisione oggi ancora in costruzione.
Dall'analisi di un milione di task di coding, la maggior parte dei problemi rilevati non deriva da intenti malevoli ma da agenti eccessivamente aggressivi nel perseguire l'obiettivo dell'utente. Il sistema di monitoraggio asincrono gira già in produzione sull'agente Gemini Spark e ha dimostrato di intercettare casi come la cancellazione accidentale di dati in tempo reale.
DeepMind ha pubblicato in parallelo "Three Layers of Agent Security", un documento per i decisori politici che copre l'agente singolo, i sistemi multi-agente e l'ecosistema globale. In un post su X, il team ha avvertito dell'esistenza di una "finestra stretta" per definire protocolli globali prima che i sistemi multi-agente raggiungano scala massiva.
Il framework vale quanto il suo punto più debole: il monitoraggio funziona finché i modelli non imparano a eluderlo. I dati dell'analisi interna mostrano però che il rischio immediato non è l'agente ribelle ma quello che sbaglia per eccesso di zelantismo — il che sposta il problema reale dalla sicurezza contro l'AI all'affidabilità dell'AI come operatore. Che DeepMind riconosca esplicitamente entrambi i livelli di rischio nella roadmap distingue questo documento dalla maggior parte delle dichiarazioni di sicurezza AI.