Microsoft: addestra MAI su dati web non autorizzati

Microsoft MAI: dati non autorizzati, promesse enterprise smentite

Microsoft aveva costruito il lancio dei modelli MAI su un argomento commerciale preciso: dati di addestramento "enterprise grade, clean and commercially licensed", distinti da quelli usati dagli altri laboratori AI. Il documento tecnico pubblicato dalla società racconta una storia diversa. Tra le fonti usate figura Common Crawl, il grande archivio del web pubblico che nessun editore ha autorizzato esplicitamente. La contraddizione è tutta qui: Microsoft ha fatto esattamente quello che i competitor fanno, pur avendo presentato la qualità dei dati come proprio elemento di differenziazione verso il mercato enterprise.

Come avevamo riportato il 3 giugno 2026, Microsoft ha presentato sette modelli AI sviluppati interamente in-house a Build 2026, con MAI-Thinking-1 dotato di un trilione di parametri e finestra di contesto da 128.000 token. Quel lancio aveva puntato molto sulla narrativa della qualità dei dati. Il paper tecnico, esaminato da ricercatori esterni dopo la pubblicazione, sgonfia proprio quella narrativa.

Le promesse commerciali e il contenuto del paper tecnico

L'affermazione originale di Microsoft era esplicita: i modelli MAI si distinguono per l'uso esclusivo di dati "enterprise grade, clean and commercially licensed." Il documento tecnico descrive invece la base di addestramento come "a mixture of publicly available and licensed human-generated data" — una formula che copre tanto fonti con licenza esplicita quanto contenuti web raccolti senza accordi diretti con i publisher originali.

Lo sviluppatore e blogger Simon Willison ha segnalato pubblicamente l'uso di Common Crawl tra le fonti citate nel paper. Common Crawl è un archivio di miliardi di pagine web raccolte tramite crawler automatici: nessun editore, giornale o blog ha firmato un contratto con Microsoft per cedere i propri contenuti a scopo di addestramento AI.

Microsoft precisa nel documento di usare "un crawler proprietario che rispetta il Robots Exclusion Protocol (robots.txt) e i relativi controlli meta-tag e HTML", delegando ai proprietari dei siti la responsabilità di gestire l'accesso ai propri contenuti. La logica implicita rovescia però il principio del consenso: chi non inserisce istruzioni esplicite nel robots.txt non sta autorizzando nulla. Il silenzio non è un via libera. Come osserva il giornalista di The Decoder Matthias Bastian, è come assumere che chi non chiude la porta a chiave acconsenta a essere derubato.

Microsoft: addestra MAI su dati web non autorizzati
Infrastruttura di data center: i sistemi di controllo proteggono i dati dall'utilizzo non autorizzato negli algoritmi moderni. Foto di Brett Sayles su Pexels

Fair use: lo scudo legale su cui si regge tutta l'industria AI

Per giustificare l'uso di dati web non licenziati, Microsoft — come tutti gli altri laboratori AI — fa affidamento sulla dottrina del fair use. Il quadro giuridico è ancora in evoluzione: i tribunali stanno definendo se e fino a che punto questa dottrina si applichi all'addestramento di modelli AI su larga scala, e non esiste ancora un orientamento stabile.

Tutta l'industria opera sulla stessa base. Altri laboratori usano dati web pubblici in misura variabile, senza accordi espliciti con la maggior parte dei publisher coinvolti. La differenza nel caso Microsoft è nel messaggio commerciale: nessun altro laboratorio aveva esplicitamente venduto la "pulizia" dei propri dati di addestramento come argomento di differenziazione per il mercato enterprise. Microsoft lo aveva fatto, e il proprio paper tecnico contraddice ora quella promessa in modo documentabile e pubblico.

Il punto è sintetizzabile senza ambiguità: Microsoft fa ciò che fanno tutti gli altri laboratori, ma aveva costruito sopra quella pratica un posizionamento che ne presentava l'esatto contrario.

Cosa cambia per le aziende che hanno adottato i modelli MAI

La rivelazione pone un problema operativo concreto per i clienti enterprise. Chi opera in settori regolamentati — finanza, sanità, editoria legale — deve spesso documentare la provenienza dei dati nei sistemi AI adottati, come requisito contrattuale o di compliance. Se l'addestramento include contenuti web non autorizzati come Common Crawl, costruire e difendere quella documentazione diventa più complesso.

Il gap tra promessa e realtà non è marginale. Presentare dati "clean and commercially licensed" come garanzia differenziale, per poi usare le stesse fonti degli altri laboratori, significa che i processi di due diligence e i contratti aziendali firmati dai clienti enterprise sono stati costruiti su premesse che il paper tecnico ora smentisce. Non è detto che i modelli MAI siano meno performanti per questo: i benchmark pubblici li collocano su livelli competitivi. Ma le garanzie vendute riguardavano i dati, non le prestazioni. E queste sono due cose distinte.

Il problema reale non è tecnico: è la distanza tra ciò che Microsoft ha comunicato pubblicamente e ciò che il documento tecnico documenta. Quella distanza è ora pubblica, verificabile, e difficile da rimettere nel cassetto.

Francesco Leone
Francesco Leone

Francesco Leone è un esperto in Intelligenza Artificiale con una profonda conoscenza in Machine Learning e Deep Learning. Attraverso la sua esperienza, ha contribuito allo sviluppo di soluzioni innovative in ambito di elaborazione del linguaggio naturale e visione artificiale, mirando a trasformare il modo in cui interagiamo con la tecnologia. Attivo nel settore con pubblicazioni e progetti su https://ital-ia.it/, Francesco si dedica alla ricerca e all'applicazione di algoritmi avanzati per rendere i sistemi più intelligenti e accessibili.

Articoli: 567

Lascia una risposta

Il tuo indirizzo email non sarà pubblicato. I campi obbligatori sono contrassegnati *