Mano robotica bianca e controller videogiochi su superficie di marmo, robotica addestrata con dati da videogame

General Intuition punta al momento ChatGPT per la robotica

La robotica sta per vivere la sua transizione dai modelli specializzati ai foundation model. General Intuition, startup con sede a New York, ha appena raccolto 320 milioni di dollari a una valutazione di 2,3 miliardi per dimostrarlo, puntando su un tipo di dato finora ignorato dall’AI fisica: milioni di ore di sessioni di videogiochi. La scommessa è che premere un tasto su un controller insegni ai robot più cose sullo spazio e sul tempo di quanto faccia un intero Internet di testo.

La logica è la stessa che ha trasformato l’elaborazione del linguaggio naturale dopo GPT-3: smettere di costruire modelli su misura per ogni compito e concentrarsi su un’intelligenza generalizzata da raffinare in pochi minuti. Il CEO Pim de Witte lo ha spiegato senza giri di parole: «La generalizzazione del modello è il prodotto».

Cosa rende i dati dei videogiochi migliori di Internet

I videogiochi contengono un’informazione che i modelli linguistici non potranno mai estrarre da pagine web e PDF: dati di azione. Ogni movimento di un giocatore è accompagnato da un input preciso — quale tasto viene premuto e quando — creando una corrispondenza tra percezione visiva e decisione motoria. Per un’intelligenza artificiale che deve muoversi nel mondo fisico, questa correlazione è più preziosa di qualunque corpus testuale.

De Witte lo ha ribadito durante un episodio del podcast Equity di TechCrunch: i modelli linguistici sono bravi con il testo ma comprendono meno bene come le cose si muovono nello spazio e nel tempo. I videogiochi, al contrario, costringono un agente a ragionare in tempo reale su distanze, ostacoli, dinamiche e conseguenze delle proprie azioni. General Intuition ha addestrato il suo modello su questi dati prima di applicarlo alla robotica.

Mano robotica bianca e controller videogiochi su superficie di marmo, robotica addestrata con dati da videogame
General Intuition raccoglie 320 milioni per insegnare ai robot attraverso milioni di ore di sessioni videoludiche.

Otto minuti di addestramento reale per controllare un robot quadrupede

Il banco di prova del foundation model è arrivato con un test tanto semplice quanto rivelatore. Il team ha preso il modello addestrato su videogiochi e lo ha raffinato con appena otto minuti di dati raccolti nel mondo reale. Risultato: il sistema ha pilotato un robot quadrupede muovendosi in un ufficio con oggetti in movimento e persone che passavano, usando solo la telecamera frontale e nessun altro sensore.

«Il fatto che sia riuscito a operare zero-shot — solo con la telecamera, senza sensori aggiuntivi, con oggetti dinamici introdotti e gente che camminava — è stata una grossa sorpresa per noi», ha ammesso de Witte. «Penso sia un segnale di quello che sta arrivando». La prestazione suggerisce che l’intuizione spaziale appresa nei videogiochi si trasferisce in ambienti reali con un bisogno minimo di dati fisici.

La strategia: il modello è il prodotto, non il robot

General Intuition non vuole costruire robot. Vuole diventare lo strato di base su cui altre aziende costruiranno i propri. De Witte traccia un parallelo esplicito con l’industria dei veicoli autonomi: «Non creeremo una compagnia di auto a guida autonoma. Renderemo dieci volte più facile per il prossimo fondare una compagnia di auto a guida autonoma».

La posta in gioco è il superamento dell’approccio attuale, dove — ha osservato il CEO — «molte aziende stanno facendo tanto lavoro specializzato su singoli robot, singoli ambienti, singole configurazioni». Un modello che generalizza l’intuizione spazio-temporale rende superflua la raccolta di centinaia di migliaia di ore di dati sul campo. «La realtà è che ti bastano pochi minuti», ha sintetizzato de Witte.

Per chi sviluppa robot, la conseguenza pratica è netta: la barriera all’ingresso si sposta dalla quantità di dati fisici raccolti alla qualità del fine-tuning. Se un modello pre-addestrato su videogiochi può colmare il divario sensoriale in meno di dieci minuti, il costo di sviluppare un nuovo robot si riduce drasticamente. Il round da 320 milioni guidato da Vinod Khosla, con Coatue, Eric Schmidt e ricercatori di MIT e Google DeepMind tra gli investitori, è la misura della posta in gioco.

Fonti

Francesco Leone
Francesco Leone

Francesco Leone è un esperto in Intelligenza Artificiale con una profonda conoscenza in Machine Learning e Deep Learning. Attraverso la sua esperienza, ha contribuito allo sviluppo di soluzioni innovative in ambito di elaborazione del linguaggio naturale e visione artificiale, mirando a trasformare il modo in cui interagiamo con la tecnologia. Attivo nel settore con pubblicazioni e progetti su https://ital-ia.it/, Francesco si dedica alla ricerca e all'applicazione di algoritmi avanzati per rendere i sistemi più intelligenti e accessibili.

Articoli: 553

Lascia una risposta

Il tuo indirizzo email non sarà pubblicato. I campi obbligatori sono contrassegnati *