Scansione di documenti con OCR 4 di Mistral AI

Mistral OCR 4: estrazione strutturata di documenti con bounding box, blocchi e punteggi di confidenza

Mistral AI ha rilasciato OCR 4, il suo ultimo modello di comprensione documenti. Non si limita a estrarre testo: restituisce bounding box per ogni blocco, etichette di tipo (titoli, tabelle, equazioni, firme) e punteggi di confidenza parola per parola. Supporta 170 lingue in 10 gruppi linguistici, con miglioramenti su lingue rare e a basse risorse.

Il cuore della novità è la struttura. Ogni blocco viene localizzato con un riquadro e classificato per funzione. I punteggi di confidenza sono generati per pagina e per parola. I sistemi downstream imparano non solo cosa dice un documento, ma dove si trova ogni elemento, che ruolo ha e quanto è affidabile. Serve per citazioni verificabili, redazioni automatiche e controlli umani.

OCR 4 accetta i formati aziendali comuni: PDF, DOC, PPT e OpenDocument. Il modello è compatto e gira in un singolo container, con deploy self-hosted per clienti enterprise che hanno esigenze di residenza dati e conformità.

Benchmark e costi

Nei test, valutatori indipendenti hanno preferito OCR 4 rispetto a ogni altro sistema testato, con un tasso di vittoria medio del 72%. La valutazione ha usato oltre 600 documenti in 12+ lingue. Sui benchmark automatizzati, OCR 4 ha ottenuto 85.20 su OlmOCRBench, 93.07 su OmniDocBench e 0.98 sul dataset interno Crawl Multilingual.

I costi sono chiari: $4 per 1.000 pagine (2$ con lo sconto Batch-API). Un endpoint unico serve sia l’estrazione pura che l’output strutturato Document AI.

Due clienti confermano i numeri. Rogo ha riportato accuratezza equivalente a un costo circa 8 volte inferiore e latenza 17 volte più bassa rispetto ai parser agentici leader. Anaqua ha misurato circa 4 volte più veloce per pagina rispetto al suo fornitore precedente.

Segmentazione, non solo testo

Le bounding box sono state la funzionalità più richiesta. Localizzano il testo per evidenziazioni in-context e pipeline dati affidabili. I tipi di blocco e i punteggi di confidenza servono a lavori diversi: citazioni verificate, redazioni e revisioni umane. Blocchi puliti e classificati diventano migliori unità di recupero per RAG. Gli agenti ricevono primitive strutturali per agire sui documenti, non solo leggerli.

Casi d’uso concreti

OCR 4 supporta sia pipeline ad alto volume che flussi di lavoro interattivi:

  • Parsing documenti: trasformare un contratto multilingua in markdown pulito per l’indicizzazione
  • RAG: blocchi classificati alimentano Search Toolkit per risposte con citazioni
  • Flussi agentici: dare a un agente per fatture campi tipizzati e bounding box per compilare moduli
  • Pipeline a soglia di confidenza: regioni a bassa confidenza vanno a revisori umani, il resto viene approvato
  • Ricerca enterprise: componente di ingestione per archivi aziendali

Mistral avverte: OCR 4 è un modello di comprensione documenti, non un decisore. Non è indicato per diagnosi mediche, giudizi legali o decisioni finanziarie ad alto rischio.

Modalità di utilizzo

Un singolo endpoint API serve tutto. Con Pure Extraction Mode ottieni markdown, bbox, blocchi e confidenze a $4/pagina. Con Document AI Mode (stesso endpoint) il modello strutturale l’output in JSON su uno schema definito dall’utente, a $5/pagina. La regola è semplice: serve contenuto grezzo? Usa la modalità pura. Serve output rimodellato in uno schema? Aggiungi i parametri Document AI alla stessa chiamata.

Per l’estrazione di base si imposta include_blocks=True e si specifica il documento. Per la revisione umana si richiede confidence_scores_granularity="word".

Mistral raccomanda il servizio Batch Inference per lavori ad alto volume, che dimezza il costo per pagina.

Articoli simili