Physical Address
304 North Cardinal St.
Dorchester Center, MA 02124
Physical Address
304 North Cardinal St.
Dorchester Center, MA 02124

Microsoft ha svelato MAI-Cyber-1-Flash, il suo primo modello di intelligenza artificiale nato per scovare vulnerabilità nel codice, e la piattaforma agentica Perception. La combinazione tra il modello specializzato e l’orchestrazione con GPT‑5.4 raggiunge il 96% sul benchmark CyberGym – 12 punti sopra Mythos di Anthropic – mentre l’architettura multi‑modello abbatte del 50% i costi operativi. Per il colosso di Redmond l’AI difensiva diventa un campo di battaglia concreto contro attaccanti sempre più automatizzati.
MAI-Cyber-1-Flash è un modello di sicurezza compatto, sviluppato per animare il framework multi‑agente MDASH già utilizzato da Microsoft nel rilevamento e nella correzione delle falle software. Sul banco di prova CyberGym, che valuta la capacità di individuare vulnerabilità reali in codebase estese, il sistema integrato con GPT‑5.4 ha centrato il 96%, lasciandosi alle spalle Gemini, GPT‑5.5 Cyber, GPT‑5.6 Sol e, appunto, Mythos 5.
Il vantaggio sul modello di Anthropic è netto: i 12 punti di scarto portano Mythos attorno all’84%. Mustafa Suleyman, CEO di Microsoft AI e co‑fondatore di DeepMind, ha rivendicato il primato: “MAI-1 Cyber Flash accoppiato con GPT 5.4 dentro il framework MDASH batte Gemini, GPT 5.5 Cyber, GPT 5.6 Sol e Mythos 5 su Cyber Gym, il benchmark di riferimento per tutti noi. Lo stiamo rilasciando subito in produzione”.
Il segreto dei costi dimezzati (–50%) sta nella distribuzione del carico: MAI-Cyber-1-Flash gestisce in autonomia circa il 90% dei task, mentre solo le richieste più ostiche vengono girate a modelli di frontiera come GPT‑5.4, molto più onerosi. Microsoft non rinuncia quindi a OpenAI per i ragionamenti complessi, ma diventa orchestratrice, adottando un modello aperto quando basta e scalando verso modelli più potenti solo quando serve.

Accanto al modello, Microsoft ha presentato Perception, una piattaforma di cybersecurity che schiera squadre di agenti con ruoli distinti. I red team simulano attacchi e profilano gli attaccanti, i blue team individuano e analizzano i bug, mentre i green team applicano direttamente le correzioni sul codice. Il sistema si integra con MDASH e automatizza l’intero ciclo di risposta.
L’impatto sui tempi di intervento è radicale. Dave Weston, lead engineer di Perception, ha spiegato: “Siamo passati da ore e ore di lavoro manuale di specialisti — cacciatori di falle applicative, ingegneri di remediation — a una soluzione completa in pochi minuti. Non solo scopriamo i problemi e li prioritizziamo, ma mettiamo a punto rilevamento, postura difensiva e persino la fix del codice”.
Per Hayete Gallot, vicepresidente sicurezza di Microsoft, si tratta di “difendersi dall’AI con l’AI alla stessa scala e velocità degli attaccanti”. Perception potrà contare su un patrimonio di 100 trilioni di segnali di sicurezza analizzati ogni giorno e sulla base di 1,6 milioni di clienti aziendali. L’anteprima pubblica è fissata al 3 novembre 2026, data che segna l’ingresso ufficiale di Microsoft in un mercato già presidiato da Anthropic (con il programma Glasswing) e OpenAI (progetto Daybreak).
Lo schema scelto da Microsoft – un modello verticale per il grosso del lavoro e un modello generalista per i picchi di complessità – ribalta l’approccio “one model fits all” adottato finora da molti concorrenti. La riduzione dei costi del 50% non è un dettaglio marginale: significa che un’azienda può attivare un monitoraggio agentico h24 senza far lievitare la bolletta del cloud, mentre i team interni guadagnano tempo da dedicare alla strategia anziché alla caccia manuale dei bug.
Microsoft gioca anche la carta del dato proprietario. I 100 trilioni di segnali giornalieri e il parco clienti da 1,6 milioni di realtà danno a Perception un vantaggio di addestramento e contesto che nessun laboratorio puro di AI può replicare in breve tempo. La dipendenza da GPT‑5.4 per i compiti più difficili, anziché indebolire la proposta, mostra una strategia di orchestrazione: Redmond non vuole sostituire OpenAI ma far convivere più motori, trattenendo per sé il controllo dell’infrastruttura difensiva. Con il rilascio imminente a novembre, la partita della cybersecurity si sposta definitivamente dall’automazione parziale a un sistema di agenti interconnessi che scoprono, decidono e riparano.