Mistral OCR 4: estrazione strutturata di documenti con bounding box, blocchi e punteggi di confidenza
Mistral AI ha rilasciato OCR 4, il suo ultimo modello di comprensione documenti. Non si limita a estrarre testo: restituisce bounding box per ogni blocco, etichette di tipo (titoli, tabelle, equazioni, firme) e punteggi di confidenza parola per parola. Supporta 170 lingue in 10 gruppi linguistici, con miglioramenti su lingue rare e a basse risorse.
Il cuore della novità è la struttura. Ogni blocco viene localizzato con un riquadro e classificato per funzione. I punteggi di confidenza sono generati per pagina e per parola. I sistemi downstream imparano non solo cosa dice un documento, ma dove si trova ogni elemento, che ruolo ha e quanto è affidabile. Serve per citazioni verificabili, redazioni automatiche e controlli umani.
OCR 4 accetta i formati aziendali comuni: PDF, DOC, PPT e OpenDocument. Il modello è compatto e gira in un singolo container, con deploy self-hosted per clienti enterprise che hanno esigenze di residenza dati e conformità.
Benchmark e costi
Nei test, valutatori indipendenti hanno preferito OCR 4 rispetto a ogni altro sistema testato, con un tasso di vittoria medio del 72%. La valutazione ha usato oltre 600 documenti in 12+ lingue. Sui benchmark automatizzati, OCR 4 ha ottenuto 85.20 su OlmOCRBench, 93.07 su OmniDocBench e 0.98 sul dataset interno Crawl Multilingual.
I costi sono chiari: $4 per 1.000 pagine (2$ con lo sconto Batch-API). Un endpoint unico serve sia l’estrazione pura che l’output strutturato Document AI.
Due clienti confermano i numeri. Rogo ha riportato accuratezza equivalente a un costo circa 8 volte inferiore e latenza 17 volte più bassa rispetto ai parser agentici leader. Anaqua ha misurato circa 4 volte più veloce per pagina rispetto al suo fornitore precedente.
Segmentazione, non solo testo
Le bounding box sono state la funzionalità più richiesta. Localizzano il testo per evidenziazioni in-context e pipeline dati affidabili. I tipi di blocco e i punteggi di confidenza servono a lavori diversi: citazioni verificate, redazioni e revisioni umane. Blocchi puliti e classificati diventano migliori unità di recupero per RAG. Gli agenti ricevono primitive strutturali per agire sui documenti, non solo leggerli.
Casi d’uso concreti
OCR 4 supporta sia pipeline ad alto volume che flussi di lavoro interattivi:
- Parsing documenti: trasformare un contratto multilingua in markdown pulito per l’indicizzazione
- RAG: blocchi classificati alimentano Search Toolkit per risposte con citazioni
- Flussi agentici: dare a un agente per fatture campi tipizzati e bounding box per compilare moduli
- Pipeline a soglia di confidenza: regioni a bassa confidenza vanno a revisori umani, il resto viene approvato
- Ricerca enterprise: componente di ingestione per archivi aziendali
Mistral avverte: OCR 4 è un modello di comprensione documenti, non un decisore. Non è indicato per diagnosi mediche, giudizi legali o decisioni finanziarie ad alto rischio.
Modalità di utilizzo
Un singolo endpoint API serve tutto. Con Pure Extraction Mode ottieni markdown, bbox, blocchi e confidenze a $4/pagina. Con Document AI Mode (stesso endpoint) il modello strutturale l’output in JSON su uno schema definito dall’utente, a $5/pagina. La regola è semplice: serve contenuto grezzo? Usa la modalità pura. Serve output rimodellato in uno schema? Aggiungi i parametri Document AI alla stessa chiamata.
Per l’estrazione di base si imposta include_blocks=True e si specifica il documento. Per la revisione umana si richiede confidence_scores_granularity="word".
Mistral raccomanda il servizio Batch Inference per lavori ad alto volume, che dimezza il costo per pagina.
