Physical Address
304 North Cardinal St.
Dorchester Center, MA 02124
Physical Address
304 North Cardinal St.
Dorchester Center, MA 02124

La robotica sta per vivere la sua transizione dai modelli specializzati ai foundation model. General Intuition, startup con sede a New York, ha appena raccolto 320 milioni di dollari a una valutazione di 2,3 miliardi per dimostrarlo, puntando su un tipo di dato finora ignorato dall’AI fisica: milioni di ore di sessioni di videogiochi. La scommessa è che premere un tasto su un controller insegni ai robot più cose sullo spazio e sul tempo di quanto faccia un intero Internet di testo.
La logica è la stessa che ha trasformato l’elaborazione del linguaggio naturale dopo GPT-3: smettere di costruire modelli su misura per ogni compito e concentrarsi su un’intelligenza generalizzata da raffinare in pochi minuti. Il CEO Pim de Witte lo ha spiegato senza giri di parole: «La generalizzazione del modello è il prodotto».
I videogiochi contengono un’informazione che i modelli linguistici non potranno mai estrarre da pagine web e PDF: dati di azione. Ogni movimento di un giocatore è accompagnato da un input preciso — quale tasto viene premuto e quando — creando una corrispondenza tra percezione visiva e decisione motoria. Per un’intelligenza artificiale che deve muoversi nel mondo fisico, questa correlazione è più preziosa di qualunque corpus testuale.
De Witte lo ha ribadito durante un episodio del podcast Equity di TechCrunch: i modelli linguistici sono bravi con il testo ma comprendono meno bene come le cose si muovono nello spazio e nel tempo. I videogiochi, al contrario, costringono un agente a ragionare in tempo reale su distanze, ostacoli, dinamiche e conseguenze delle proprie azioni. General Intuition ha addestrato il suo modello su questi dati prima di applicarlo alla robotica.

Il banco di prova del foundation model è arrivato con un test tanto semplice quanto rivelatore. Il team ha preso il modello addestrato su videogiochi e lo ha raffinato con appena otto minuti di dati raccolti nel mondo reale. Risultato: il sistema ha pilotato un robot quadrupede muovendosi in un ufficio con oggetti in movimento e persone che passavano, usando solo la telecamera frontale e nessun altro sensore.
«Il fatto che sia riuscito a operare zero-shot — solo con la telecamera, senza sensori aggiuntivi, con oggetti dinamici introdotti e gente che camminava — è stata una grossa sorpresa per noi», ha ammesso de Witte. «Penso sia un segnale di quello che sta arrivando». La prestazione suggerisce che l’intuizione spaziale appresa nei videogiochi si trasferisce in ambienti reali con un bisogno minimo di dati fisici.
General Intuition non vuole costruire robot. Vuole diventare lo strato di base su cui altre aziende costruiranno i propri. De Witte traccia un parallelo esplicito con l’industria dei veicoli autonomi: «Non creeremo una compagnia di auto a guida autonoma. Renderemo dieci volte più facile per il prossimo fondare una compagnia di auto a guida autonoma».
La posta in gioco è il superamento dell’approccio attuale, dove — ha osservato il CEO — «molte aziende stanno facendo tanto lavoro specializzato su singoli robot, singoli ambienti, singole configurazioni». Un modello che generalizza l’intuizione spazio-temporale rende superflua la raccolta di centinaia di migliaia di ore di dati sul campo. «La realtà è che ti bastano pochi minuti», ha sintetizzato de Witte.
Per chi sviluppa robot, la conseguenza pratica è netta: la barriera all’ingresso si sposta dalla quantità di dati fisici raccolti alla qualità del fine-tuning. Se un modello pre-addestrato su videogiochi può colmare il divario sensoriale in meno di dieci minuti, il costo di sviluppare un nuovo robot si riduce drasticamente. Il round da 320 milioni guidato da Vinod Khosla, con Coatue, Eric Schmidt e ricercatori di MIT e Google DeepMind tra gli investitori, è la misura della posta in gioco.