Physical Address
304 North Cardinal St.
Dorchester Center, MA 02124
Physical Address
304 North Cardinal St.
Dorchester Center, MA 02124

OCR 4 non si limita a estrarre testo grezzo dai documenti: classifica ogni elemento — titolo, tabella, equazione, firma — con bounding box e confidence score per parola e per pagina. In un blind test indipendente su oltre 600 documenti, i revisori hanno preferito OCR 4 il 72% delle volte rispetto ai modelli concorrenti. Per chi costruisce pipeline RAG o sistemi di ricerca enterprise, il modello segna un cambio netto rispetto al semplice riconoscimento ottico tradizionale.
OCR 4 introduce la block classification: ogni elemento estratto riceve un'etichetta tipizzata — titolo, paragrafo, tabella, equazione, firma — insieme alle coordinate precise della sua posizione sulla pagina. Questo consente di suddividere automaticamente un PDF o un file Word in sezioni significative, senza dover ricorrere a parser separati a valle.
A ogni parola e a ogni pagina viene associato un confidence score, che quantifica il grado di certezza del riconoscimento. Un documento con pagine a bassa affidabilità può essere segnalato o filtrato prima di entrare in un sistema di indicizzazione, riducendo il rumore nelle pipeline a valle.
Il modello supporta 170 lingue, comprese quelle meno diffuse, e funziona su PDF, file Word e presentazioni PowerPoint.

OCR 4 è disponibile via API, tramite Mistral Studio e su Microsoft Foundry. Il modello ha due modalità di accesso:
| Modalità | Costo per 1.000 pagine |
|---|---|
| Standard | $4,00 |
| Batch | $2,00 |
La modalità batch dimezza il costo rispetto alla standard. Su un volume di 10.000 pagine il risparmio è di $20; su scala enterprise — archivi di contratti, knowledge base documentali, repository legali — la differenza diventa rilevante.
I sistemi di retrieval-augmented generation dipendono dalla qualità con cui i documenti vengono segmentati prima dell'indicizzazione. Un OCR che restituisce testo piatto impone strati aggiuntivi di parsing per distinguere un'intestazione da un corpo di testo. OCR 4 elimina questo passaggio: la struttura è già incorporata nell'output del modello.
Considerando i dati del blind test: su oltre 600 documenti valutati, più di 430 preferenze sono andate a OCR 4 — una maggioranza che, su campioni di questa dimensione, indica una superiorità robusta e non marginale rispetto ai modelli concorrenti. Abbinato ai confidence score per pagina, il modello consente di filtrare automaticamente le sezioni a bassa affidabilità prima che entrino nel corpus.
Il vero banco di prova sarà la tenuta su documenti degradati o con layout complessi — il tipo di materiale che negli archivi enterprise rappresenta spesso la maggioranza dei file reali.