Physical Address
304 North Cardinal St.
Dorchester Center, MA 02124
Physical Address
304 North Cardinal St.
Dorchester Center, MA 02124

A partire dal 14 agosto 2026 Claude Code avvierà ogni nuova sessione con l’Auto Mode già attiva per gli abbonamenti Pro, Max e Team. Anthropic non si limita a suggerire la modalità automatica: la imposta come scelta predefinita, convinta che un classificatore automatico possa intercettare molti più comandi dannosi di quanti ne riconosca uno sviluppatore che approva manualmente ogni passo. In uno studio controllato con 1.053 tester pagati, solo il 13,6% dei partecipanti ha rifiutato un’azione pericolosa inserita di nascosto nella sessione; l’Auto Mode avrebbe bloccato l’89% di quelle stesse azioni.
L’Auto Mode permette a Claude Code di eseguire in autonomia la maggior parte delle operazioni di sviluppo, senza chiedere conferma a ogni passo. Un classificatore interno valuta se un’azione è pericolosa o irreversibile e interrompe l’agente solo in quei casi, chiedendo l’intervento umano. Nei test condotti da Anthropic e in un audit indipendente, il meccanismo ha mostrato un tasso di errore inferiore a quello delle approvazioni manuali. Durante l’AI Engineer World’s Fair, Cat Wu e Thariq Shihipar, membri del team Anthropic, hanno dichiarato che «praticamente ogni persona all’interno di Anthropic usa l’auto mode». Cat Wu ha poi aggiunto che «per le principali categorie di rischio che ci preoccupano, come il prompt injection e l’esfiltrazione di dati, i rischi sono molto inferiori a quelli di un revisore umano medio».
L’esperimento condotto su 1.053 tester pagati ha sostituito, a metà sessione, una richiesta di permesso con un comando chiaramente pericoloso. Solo il 13,6% dei tester ha negato l’approvazione, mentre il classificatore dell’Auto Mode avrebbe fermato l’89% delle azioni dannose. In termini relativi, l’Auto Mode è stata circa 6,5 volte più efficace nell’intercettare il pericolo rispetto al giudizio umano immediato. Resta però un 11% di comandi dannosi che la modalità automatica non avrebbe bloccato: un margine che Anthropic stessa invita a tenere presente, specie quando si lavora su infrastrutture di produzione.
L’aumento di produttività è un altro dato emerso dalla transizione all’Auto Mode: i team che la utilizzano producono circa il 25% in più di pull request, segno che l’eliminazione delle continue approvazioni accelera il ciclo di sviluppo.

La vera partita di sicurezza per gli agenti di codice è il prompt injection indiretto, cioè istruzioni malevole nascoste in contenuti che l’agente legge da fonti esterne. Trajectory Labs, laboratorio indipendente, ha condotto un audit su 72 scenari di attacco non condivisi con Anthropic, eseguendo ciascuno 10 volte. Contro Claude Fable 5, Opus 5 e Sonnet 5 in Auto Mode, nessuno dei 720 tentativi è andato a segno. Per confronto, con GPT-5.6 Sol in modalità Codex Auto-Review, il 5,83% degli attacchi ha avuto successo.
Simon Willison, sviluppatore e commentatore molto seguito sull’AI, segnala però uno scenario che meriterebbe ulteriori verifiche indipendenti: un pacchetto malevolo potrebbe istruire l’agente a eseguire un comando apparentemente legittimo come uvx fetch-model-files . prima dei test, dove fetch-model-files è un secondo pacchetto pensato per esfiltrare dati. In questo caso, nota Willison, non è chiaro come l’Auto Mode possa distinguere un’istruzione legittima da un attacco orchestrato su più livelli.
Per gli sviluppatori su piani Pro, Max e Team, dal 14 agosto l’Auto Mode sarà attiva di default senza costi aggiuntivi per i token consumati dal classificatore. Il vantaggio immediato è una riduzione drastica delle interruzioni: Claude lavora in autonomia su task complessi e chiede conferma solo quando il rischio lo richiede. Anthropic raccomanda comunque di mantenere la revisione umana per le modifiche ad alta criticità, come quelle che toccano l’infrastruttura di produzione.
La modifica solleva un paradosso già noto nell’automazione della cybersecurity: meno spesso l’umano interviene, più ogni suo intervento diventa decisivo, ma al tempo stesso è più difficile mantenere una comprensione profonda di progetti costruiti in gran parte dall’agente. Dentro Anthropic, l’Auto Mode ha già impedito il caricamento di dati confidenziali su una pagina pubblica e ha terminato circa 2.000 processi che avrebbero interrotto job di training GPU in corso: due episodi che mostrano l’efficacia del sistema, ma anche la quantità di decisioni che vengono ormai delegate alla macchina.
Il passaggio all’Auto Mode predefinita rappresenta una scommessa esplicita: Anthropic ritiene che il costo degli errori umani da “affaticamento da conferma” sia oggi più alto del rischio residuo gestito dal classificatore. Tradotto in numeri, il tasso di approvazione di comandi pericolosi crolla dall’86,4% delle sessioni con supervisione umana (il complemento del 13,6% che ha rifiutato) all’11% con l’Auto Mode. Una riduzione del rischio di oltre l’87% che, se confermata su larga scala, potrebbe ridefinire gli standard di sicurezza per tutti gli strumenti di sviluppo basati su AI.