Physical Address
304 North Cardinal St.
Dorchester Center, MA 02124
Physical Address
304 North Cardinal St.
Dorchester Center, MA 02124

L'infrastruttura per addestrare e far operare gli agenti autonomi sta convergendo su un'architettura a strati separati — e tre novità pubblicate tra il 7 e l'8 giugno 2026 lo rendono visibile. OpenEnv diventa un progetto condiviso da un consorzio di organizzazioni, Perplexity ridefinisce come un agente esegue ricerche complesse, e datasette-agent-edit porta la stessa logica all'editing autonomo di testi. Il punto comune non è cosmetico: chi costruisce agenti open source stava pagando un costo strutturale rispetto ai modelli frontier, e ora emergono gli strumenti per colmare quel gap.
OpenEnv è una libreria che fa da interfaccia tra harness, environment e sistema di training, compatibile con qualsiasi modello. L'8 giugno 2026 il progetto ha annunciato un cambio di governance: da oggi è coordinato da un comitato che include Meta-PyTorch, Reflection, Unsloth, Modal, Prime Intellect, Nvidia, Mercor, Fleet AI e Hugging Face, con il codice ospitato su huggingface/OpenEnv.
Il problema che OpenEnv risolve è specifico. Harness come Claude Code, Codex, OpenClaw e Hermes migliorano continuamente in parte perché i modelli proprietari — come GPT-5.5 e Opus 4.8 — vengono addestrati appositamente per usarli. Chi vuole gli stessi guadagni di efficienza con modelli open source ha bisogno di un layer di interoperabilità condiviso. OpenEnv si posiziona come quel substrato.
Il progetto non entra nella definizione dei reward: standardizza solo come gli ambienti vengono pubblicati, distribuiti e consumati dagli agenti. Reward framework, scoring rubric e logiche di training restano nei rispettivi tool specializzati. In pratica, l'architettura espone:
reset(), step(), state()) su architettura client/serverLa roadmap prevede nei prossimi mesi: taskset collegati a dataset Hugging Face (RFC 006), reward esterni (RFC 007) e auto-validazione degli ambienti per misurarne il contributo all'apprendimento dei modelli (RFC 008).
"Search as Code" (SaC) è la risposta di Perplexity a un collo di bottiglia preciso: i motori di ricerca attuali sono costruiti per umani che vogliono una lista di link, non per agenti che devono eseguire centinaia di query in pochi minuti. Invece di chiamare un'API prefissata, il modello scrive uno script Python personalizzato che gira in un sandbox sicuro e accede direttamente alle funzioni elementari del backend di ricerca.
L'architettura si articola in tre layer:

| Layer | Ruolo |
|---|---|
| Modello | Comprende il task e scrive il codice di ricerca |
| Sandbox | Esecuzione isolata e sicura dello script |
| Agentic Search SDK | Accesso granulare a fetch, filter, dedup, rerank |
Il vantaggio operativo principale riguarda la gestione del context window. Con le pipeline tradizionali, i filtri sono chiusi dentro l'API: l'agente riceve risultati non pre-filtrati che riempiono il contesto di rumore. Quando l'agente scrive i propri filtri, la finestra contestuale rimane pulita anche su sessioni di ricerca lunghe.
Il test di riferimento riguarda 200 CVE — vulnerabilità software critiche pubblicate tra il 2023 e il 2025 — per cui l'agente doveva trovare l'advisory ufficiale del vendor, il software colpito e la versione esatta del fix. Con SaC, il modello ha costruito uno script in tre fasi: ricerche parallele per vendor (Mozilla, Google), analisi autonoma dei gap e query di follow-up mirate, verifica con schema strutturato. Risultato: 85% di token in meno rispetto alla pipeline standard di Perplexity. I sistemi concorrenti hanno recuperato meno di un quarto dei dati corretti.
Nei benchmark interni, SaC supera OpenAI Responses API e Anthropic Managed Agents in 4 categorie su 5 — in pareggio sostanziale con OpenAI solo su HLE. Il margine più ampio è su "WANDR", benchmark per ricerche broad che Perplexity prevede di rilasciare presto. Trattandosi di dati autoprodotti, vanno letti con cautela; il confronto tra SaC e la vecchia pipeline interna sullo stesso hardware mostra però un salto consistente e verificabile. SaC è disponibile da giugno 2026 su Perplexity Computer e nell'Agent API.
Il 7 giugno 2026 Simon Willison ha rilasciato datasette-agent-edit 0.1a0, plugin base per Datasette Agent con strumenti di editing testuale riutilizzabili: view (sezioni con numeri di riga), str_replace (rimpiazza una stringa esatta — fallisce se non è univoca nel file), insert (testo dopo numero di riga). Il design riprende quello del text editor di Claude. L'obiettivo è evitare di reimplementare questi pattern per ogni plugin che gestisce editing agentici — markdown collaborativo, query SQL lunghe, SVG — creando invece un layer base condiviso da estendere.
I tre sviluppi condividono una logica: spostare la logica di orchestrazione dal codice fisso al codice che l'agente costruisce al momento. OpenEnv lo fa per il training. Search as Code lo fa per la ricerca. datasette-agent-edit lo fa per l'editing di testo.
Il dato dell'85% di riduzione token offre una misura concreta: la stessa quantità di token che nella pipeline standard permette di analizzare una singola CVE, con SaC ne copre circa sei e mezzo (1 ÷ 0,15 = 6,67). Su un task da 200 vulnerabilità, questo è il margine tra un sistema che esaurisce il contesto e uno che lo gestisce. Un paper di survey citato da The Decoder descrive il codice come il nuovo layer operativo degli agenti, con sandbox e strumenti di verifica come il vero collo di bottiglia per i sistemi autonomi.
Il vero test per OpenEnv non sarà il numero di organizzazioni nel comitato, ma la capacità di diventare il socket comune su cui modelli open source ottengono gli stessi guadagni di efficienza che i modelli frontier ottengono con i propri harness proprietari.