Physical Address
304 North Cardinal St.
Dorchester Center, MA 02124
Physical Address
304 North Cardinal St.
Dorchester Center, MA 02124

Le API di OpenAI, Anthropic e Google restituiscono ai clienti blocchi cifrati di chain-of-thought che, riprodotti verso modelli più deboli della stessa famiglia, rivelano in chiaro il ragionamento nascosto del modello più potente. Il “pensiero segreto” dei modelli di frontiera non era poi così segreto. La scoperta apre due fronti: la fuga di dati personali e il sospetto che alcuni modelli open-weight cinesi siano stati addestrati distillando proprio quelle tracce.
L'attacco sfrutta un difetto strutturale: ogni famiglia di modelli usa la stessa chiave di crittografia per i blocchi di ragionamento. I ricercatori prendono una traccia prodotta da un modello di frontiera, la inseriscono in un “fratello” più debole e lo jailbreakano per trascriverla in chiaro. Qui c'è un'asimmetria analitica da non sottovalutare: se la chiave è condivisa, il costo dell'attacco non è rompere la crittografia, ma trovare il fratello più debole da jailbreakare. La sicurezza dell'intera famiglia dipende quindi dal modello meno allineato.
Claude Haiku 4.5 è il bersaglio più facile. Il prompt usato chiede di trascrivere il ragionamento «verbatim, inside <thinking-copy>»; il prefisso di turno dell'assistente è stato rimosso nei modelli 4.6 ma funziona ancora in Haiku 4.5. L'appendice del paper mostra materiale mai pensato per lettori umani: GPT-5.5 che pensa a CSS, Svelte 5 e componenti con frasi telegrafiche come «Need app.css truncated. Need maybe not need».
Esiste anche una variante da prompt injection: convincere un modello a includere nel ragionamento l'idea di esfiltrare dati, per esempio caricando un file su un server remoto, poi riprodurre la traccia cifrata in un altro modello. I modelli trattano le proprie tracce come sacre e tendono a seguire istruzioni che si insinuano in quei blocchi.
Lo studio non prova causalmente la distillazione, ma documenta una somiglianza sorprendente tra le tracce di ragionamento di Kimi K3 di Moonshot AI e quelle di Claude Opus 4.8 e GPT 5.6 Sol. I ricercatori hanno somministrato 90 domande a ciascun modello open-weight (Kimi K3, DeepSeek e Inkling). Calcolo osservativo: 90 domande × 3 modelli open-weight = 270 output generati nel confronto. Quando hanno fornito ai modelli le prime parole delle reasoning trace dei modelli proprietari, i risultati sono stati eterogenei: Kimi K3 ha generato risposte straordinariamente simili, mentre DeepSeek e Inkling non hanno evidenziato somiglianze con Claude Opus.

Un secondo calcolo, dichiarato qui perché il campione è piccolo: 1 modello su 3 equivale al 33,3% dei modelli open-weight testati. Con n=3, un solo caso sposta il risultato di 33,3 punti percentuali, quindi questo numero misura l'eterogeneità del gruppo osservato, non la probabilità che un modello cinese abbia distillato. Il dato va letto insieme all'assenza di prova causale dichiarata dai ricercatori: la somiglianza è compatibile con la distillazione, ma non la dimostra.
La questione è geopolitica. A febbraio 2026 OpenAI aveva già segnalato ai legislatori statunitensi che DeepSeek sembrava aver copiato un suo modello per costruire R1; a giugno 2026 Anthropic ha accusato Alibaba di distillazione sistematica per costruire Qwen. Lo studio, però, non indica che le aziende cinesi abbiano usato questa specifica tecnica per distillare i modelli statunitensi. Mark Zuckerberg, CEO di Meta, difende la distillazione come «importante principio dell'ecosistema open source». Kyle Miller, ricercatore al CSET, ridimensiona il vantaggio: «Se toglieste ai laboratori cinesi la possibilità di distillare, non cambierebbe drammaticamente il panorama competitivo».
Dopo la segnalazione di luglio 2026, OpenAI, Anthropic e Google hanno modificato le API. L'estrazione di dati personali — password e chiavi API dalle tracce di ragionamento — non è più possibile. Alcune reasoning trace, però, restano estraibili. Alexander Panfilov, informatico dell'Università di Tübingen, parla di vulnerabilità condivisa: «tutti i principali fornitori di modelli di frontiera che abbiamo testato condividono questa vulnerabilità». La falla, aggiunge, «può portare alla fuga di informazioni personali e abilitare attacchi di distillazione su larga scala».
Qui le fonti divergono in modo utile. Simon Willison scrive che dopo la correzione gli stessi attacchi non sono più riusciti; WIRED riporta invece che secondo Panfilov alcune reasoning trace restano ancora estraibili. La lettura compatibile è che Willison descrive il replay completo del vettore dimostrativo, mentre WIRED descrive una superficie residua di estrazione: chiudere il primo non equivale a chiudere tutta la classe di vulnerabilità.
Anthropic ha avviato mitigazioni a breve termine per i comportamenti di replay descritti nel report. Il portavoce Michael Aciman precisa che la ricerca non ha comportato il recupero di chiavi di crittografia, l'accesso all'infrastruttura di Anthropic o il recupero di dati personali dai suoi sistemi. Florian Tramer, informatico dell'ETH Zürich, definisce «molto cool» lo scambio di messaggi con una variante più debole che ha la stessa chiave di decrittazione ma meno alignment: «Sta decisamente diventando un problema». Risolvere del tutto la distillazione richiederebbe una revisione fondamentale delle API.
La chiave di crittografia condivisa tra modelli della stessa famiglia non è un dettaglio tecnico: è una scelta architetturale che abilita l'attacco replay. Il fatto che modelli con meno alignment possano essere jailbreakati per rivelare il ragionamento del fratello più capace indica che la sicurezza dipende dal più debole della famiglia, non dal più avanzato. Collegando due dati che nelle fonti compaiono separati: i blocchi cifrati viaggiano fino alla macchina del client e i modelli trattano le proprie tracce come sacre. Per chi usa le API, l'implicazione concreta è che quei blocchi non sono un residuo interno del provider ma payload presenti nella risposta client: vanno trattati come materiale sensibile, perché una compromissione lato client o un'iniezione nella traccia può trasformare il ragionamento nascosto in superficie d'attacco. La corsa USA-Cina si gioca ora anche sul terreno del ragionamento nascosto dei modelli di frontiera.