Physical Address
304 North Cardinal St.
Dorchester Center, MA 02124
Physical Address
304 North Cardinal St.
Dorchester Center, MA 02124

A Build 2026 del 3 giugno 2026, Microsoft ha presentato sette modelli AI sviluppati interamente in-house che ridefiniscono la propria postura strategica nel settore. Il punto centrale è MAI-Thinking-1, il primo reasoning model dell'azienda con 1 trilione di parametri totali, ma i benchmark pubblici lo collocano alla pari con Deepseek V3.2 — non al vertice assoluto. La vera scommessa di Build 2026 non è un singolo modello, ma un ecosistema integrato che copre addestramento, personalizzazione, governance e agenti autonomi.
Tutti i modelli della famiglia MAI condividono la stessa base dati, infrastruttura e pipeline di valutazione, e sono disponibili su Azure Foundry con la possibilità, per la prima volta, di eseguire fine-tuning diretto dei pesi.
| Modello | Specializzazione | Caratteristiche principali |
|---|---|---|
| MAI-Thinking-1 | Reasoning avanzato | 1T param. totali, 35B attivi, 128k token di contesto |
| MAI-Code-1-Flash | Coding agentivo | 5 miliardi di param., integrato in GitHub Copilot e VS Code |
| MAI-Image-2.5 | Text-to-image / editing | 2° su Arena-Score (dopo GPT-Image-2, davanti ai modelli Nano-Banana di Google) |
| MAI-Transcribe-1.5 | Trascrizione audio | 43 lingue supportate |
| MAI-Voice-2 | Sintesi vocale | 15 lingue, clonazione vocale da campioni brevi |
MAI-Thinking-1 concentra la maggior parte dell'attenzione: 1 trilione di parametri totali, 35 miliardi attivi, finestra di contesto da 128.000 token, progettato per istruzioni multi-step, contesti lunghi e generazione di codice. Mustafa Suleyman, chief AI officer di Microsoft, ha sottolineato che il modello è stato addestrato da zero su dati puliti senza distillazione da modelli di terze parti — una presa di distanza implicita da pratiche di altri laboratori. Nei test interni, avrebbe battuto Anthropic Claude Sonnet 4.6 in confronti ciechi. I benchmark pubblici, però, lo collocano grosso modo alla pari con Deepseek V3.2: prestazioni solide, ma distanti dalle affermazioni più ambiziose.
Frontier Tuning consente alle aziende di allineare i modelli MAI ai propri flussi di lavoro tramite reinforcement learning. La premessa è diretta: il dato più prezioso per ottimizzare un agente non è un dataset generico, ma la traccia reale di lavoro prodotta all'interno di un'organizzazione.
I risultati dichiarati sono netti. Un modello MAI ottimizzato per Excel ha raggiunto le prestazioni di GPT-5.4 con efficienza fino a dieci volte superiore. In un progetto con McKinsey, un modello MAI personalizzato ha ottenuto il tasso di successo più alto tra tutti i sistemi testati, ancora a un decimo del costo rispetto alle alternative.

Microsoft Scout è il primo "Autopilot" di Microsoft: un agente persistente con identità propria su Entra, integrato in Teams, Outlook, OneDrive e SharePoint. Coordina meeting tra fusi orari, prepara materiali di briefing, schedula deliverable e segnala decisioni in stallo. La componente Work IQ costruisce una memoria contestuale delle priorità e abitudini di lavoro dell'utente. Ogni azione sensibile richiede approvazione umana; l'esecuzione è sandboxed tramite Microsoft Execution Containers. Scout è disponibile come rilascio sperimentale nel programma Frontier e richiede configurazione Intune e una licenza GitHub Copilot.
ASSERT (Adaptive Spec-driven Scoring for Evaluation and Regression Testing) è un framework open source che trasforma descrizioni in linguaggio naturale dei comportamenti attesi in test strutturati e scorati, eseguiti automaticamente sul sistema target. Registra anche i percorsi intermedi — tool call incluse — per localizzare i punti esatti di fallimento. Sarah Bird, Chief Product Officer of Responsible AI di Microsoft, ha sintetizzato la logica: "If you really want to have a trustworthy system, you should evaluate many more dimensions that are application-specific."
ACS (Agent Control Specification) è uno standard open source per definire policy granulari sulle azioni consentite a un agente: cosa può fare, cosa non può fare, quando richiedere approvazione umana, cosa registrare per audit. Le verifiche avvengono in più punti del workflow. L'SDK è compatibile con LangChain, OpenAI Agents SDK, Anthropic Agents SDK, AutoGen, CrewAI, Semantic Kernel e altri framework; le policy si scrivono come file singoli, portabili tra ambienti diversi.
Microsoft ha anche annunciato il Surface RTX Spark Dev Box, workstation locale per lo sviluppo AI con chip Nvidia Arm-based Spark RTX e 128 GB di memoria unificata (prezzi e specifiche complete non ancora resi noti). Con Project Solara, l'azienda prevede un sistema operativo basato su Android per eseguire agenti su dispositivi, sviluppato con Qualcomm e MediaTek. In ambito sanitario, una partnership con la Mayo Clinic porterà a un modello clinico fondazionale, distribuito prima nelle operazioni interne della clinica e poi disponibile su Azure Foundry, con la Mayo Clinic che mantiene la proprietà.
MAI-Thinking-1 non è il modello di reasoning più potente disponibile a giugno 2026 — e la distanza tra la narrazione di Microsoft ("preferito rispetto a Sonnet 4.6 nei test interni") e il posizionamento sui benchmark pubblici (alla pari con Deepseek V3.2) è il dato su cui vale la pena fermarsi. La vera architettura dell'offerta è verticale e integrata: stessa pipeline per tutti e sette i modelli, fine-tuning aperto dei pesi, strumenti di governance nativi (ASSERT, ACS), un agente aziendale persistente (Scout) e un metodo di personalizzazione (Frontier Tuning) che promette prestazioni da fascia alta a costi decimati. Chi sviluppa su Azure non sta scegliendo il singolo modello più capace del mondo, ma una piattaforma in cui costo, controllo e personalizzazione convergono — ed è su quella leva che si gioca la competizione con Google.