Mistral AI rilascia OCR 4 per estrazione strutturata di documenti

Mistral OCR 4 supera i competitor nel 72% dei test in cieco

OCR 4 non si limita a estrarre testo grezzo dai documenti: classifica ogni elemento — titolo, tabella, equazione, firma — con bounding box e confidence score per parola e per pagina. In un blind test indipendente su oltre 600 documenti, i revisori hanno preferito OCR 4 il 72% delle volte rispetto ai modelli concorrenti. Per chi costruisce pipeline RAG o sistemi di ricerca enterprise, il modello segna un cambio netto rispetto al semplice riconoscimento ottico tradizionale.

La block classification trasforma i documenti in dati strutturati

OCR 4 introduce la block classification: ogni elemento estratto riceve un'etichetta tipizzata — titolo, paragrafo, tabella, equazione, firma — insieme alle coordinate precise della sua posizione sulla pagina. Questo consente di suddividere automaticamente un PDF o un file Word in sezioni significative, senza dover ricorrere a parser separati a valle.

A ogni parola e a ogni pagina viene associato un confidence score, che quantifica il grado di certezza del riconoscimento. Un documento con pagine a bassa affidabilità può essere segnalato o filtrato prima di entrare in un sistema di indicizzazione, riducendo il rumore nelle pipeline a valle.

Il modello supporta 170 lingue, comprese quelle meno diffuse, e funziona su PDF, file Word e presentazioni PowerPoint.

Mistral AI rilascia OCR 4 per estrazione strutturata di documenti
Negativi fotografici sottoposti a scansione con strumentazione professionale. Foto di Jakub Zerdzicki su Pexels

Prezzi e disponibilità

OCR 4 è disponibile via API, tramite Mistral Studio e su Microsoft Foundry. Il modello ha due modalità di accesso:

ModalitàCosto per 1.000 pagine
Standard$4,00
Batch$2,00

La modalità batch dimezza il costo rispetto alla standard. Su un volume di 10.000 pagine il risparmio è di $20; su scala enterprise — archivi di contratti, knowledge base documentali, repository legali — la differenza diventa rilevante.

Cosa cambia per le pipeline RAG

I sistemi di retrieval-augmented generation dipendono dalla qualità con cui i documenti vengono segmentati prima dell'indicizzazione. Un OCR che restituisce testo piatto impone strati aggiuntivi di parsing per distinguere un'intestazione da un corpo di testo. OCR 4 elimina questo passaggio: la struttura è già incorporata nell'output del modello.

Considerando i dati del blind test: su oltre 600 documenti valutati, più di 430 preferenze sono andate a OCR 4 — una maggioranza che, su campioni di questa dimensione, indica una superiorità robusta e non marginale rispetto ai modelli concorrenti. Abbinato ai confidence score per pagina, il modello consente di filtrare automaticamente le sezioni a bassa affidabilità prima che entrino nel corpus.

Il vero banco di prova sarà la tenuta su documenti degradati o con layout complessi — il tipo di materiale che negli archivi enterprise rappresenta spesso la maggioranza dei file reali.

Fonti

Francesco Leone
Francesco Leone

Francesco Leone è un esperto in Intelligenza Artificiale con una profonda conoscenza in Machine Learning e Deep Learning. Attraverso la sua esperienza, ha contribuito allo sviluppo di soluzioni innovative in ambito di elaborazione del linguaggio naturale e visione artificiale, mirando a trasformare il modo in cui interagiamo con la tecnologia. Attivo nel settore con pubblicazioni e progetti su https://ital-ia.it/, Francesco si dedica alla ricerca e all'applicazione di algoritmi avanzati per rendere i sistemi più intelligenti e accessibili.

Articoli: 553

Lascia una risposta

Il tuo indirizzo email non sarà pubblicato. I campi obbligatori sono contrassegnati *