OpenAI pubblica LifeSciBench: benchmark di 750 task per valutare IA nella ricerca biomedica

OpenAI lancia LifeSciBench: 750 task per l’IA nella ricerca biomedica

OpenAI ha pubblicato LifeSciBench, un benchmark costruito da 173 ricercatori PhD per stabilire se i modelli di intelligenza artificiale frontier riescono davvero ad affrontare compiti reali nelle scienze della vita. La novità non è un test di conoscenze enciclopediche: è una metrica calibrata su workflow autentici di ricerca biomedica, un piano di valutazione che i benchmark generalisti non coprono.

750 task su sette domini biologici e sette workflow

Il benchmark include 750 task esperti, distribuiti su sette domini biologici e strutturati attorno a sette workflow di ricerca — le fasi operative che un ricercatore attraversa sul campo. Le valutazioni seguono rubriche scritte da esperti PhD, criterio che garantisce confrontabilità tra modelli diversi.

Dividendo i 750 task per i sette domini, ogni area biologica copre in media circa 107 task: una granularità sufficiente a distinguere le prestazioni in sottocampi specifici, anziché appiattirle in un punteggio unico.

OpenAI pubblica LifeSciBench: benchmark di 750 task per valutare IA nella ricerca biomedica
Ricercatrice in laboratorio dotato di microscopi e materiali didattici. Foto di Yusuf Çelik su Pexels

Anziché misurare il recupero mnemonico, LifeSciBench valuta se un modello sa navigare i passaggi reali di un'indagine biomedica. Le due capacità non coincidono quasi mai.

LifeSciBench come strumento di selezione per l'IA biomedica

LifeSciBench offre ai team di sviluppo uno strumento di selezione oggettivo: con 750 scenari realistici e rubrica esperta, è possibile confrontare sistemi diversi sullo stesso set di compiti concreti, senza affidarsi a benchmark inadeguati al ragionamento biomedico.

Il lancio si inserisce in una fase di forte investimento di OpenAI nel settore salute. Secondo quanto riportato da media specializzati, l'azienda coordinerebbe una rete di 260 medici specialisti in 60 paesi, operativa in 49 lingue — un dato che non è stato possibile verificare su fonti primarie ufficiali al momento della pubblicazione. Costruire LifeSciBench ha richiesto, secondo le stesse fonti, 173 ricercatori PhD: anche le cifre centrali del benchmark non risultano al momento confermate da comunicati ufficiali OpenAI o da pubblicazioni scientifiche di riferimento.

Fonti

Francesco Leone
Francesco Leone

Francesco Leone è un esperto in Intelligenza Artificiale con una profonda conoscenza in Machine Learning e Deep Learning. Attraverso la sua esperienza, ha contribuito allo sviluppo di soluzioni innovative in ambito di elaborazione del linguaggio naturale e visione artificiale, mirando a trasformare il modo in cui interagiamo con la tecnologia. Attivo nel settore con pubblicazioni e progetti su https://ital-ia.it/, Francesco si dedica alla ricerca e all'applicazione di algoritmi avanzati per rendere i sistemi più intelligenti e accessibili.

Articoli: 553

Lascia una risposta

Il tuo indirizzo email non sarà pubblicato. I campi obbligatori sono contrassegnati *