Mistral OCR 4.1 ora può indicare il paragrafo esatto letto
Il lettore di documenti del laboratorio francese ora restituisce le coordinate a livello di paragrafo, etichetta ciascun blocco per tipo e assegna un punteggio alla propria confidenza. Noioso sulla carta ed è esattamente ciò che rende controllabili le risposte dei documenti AI.
Giovedì l’OCR 4.1 di Mistral è apparso in prima pagina su Hacker News, cosa insolita per un lettore di documenti. OCR sta per riconoscimento ottico dei caratteri, il vecchio e poco affascinante lavoro di trasformare una scansione o un PDF in testo con cui un computer può lavorare. La nuova versione aggiunge tre cose che sembrano tecniche e si rivelano molto importanti: riquadri di delimitazione a livello di paragrafo, etichette di blocco strutturale e punteggi di confidenza per blocco.
In parole povere: quando il modello legge una pagina, non restituisce più solo un muro di testo. Ti dice da dove proviene ogni paragrafo nella pagina, come coordinate. Etichetta ciò che è ciascun blocco, in tredici categorie tra cui titolo, elenco, tabella, immagine, equazione e codice. E allega un numero che indica quanto è sicuro su ciascun blocco, a livello di pagina, blocco o parola, a seconda di ciò che chiedi.
Questa combinazione è ciò che rende controllabile una risposta. Se punti uno strumento di intelligenza artificiale su un contratto di 200 pagine e chiedi qual è il periodo di preavviso, la versione utile di quella risposta non è solo “tre mesi”. Si tratta di “tre mesi”, più un’evidenziazione a pagina 143 che mostra esattamente la frase da cui proviene. I riquadri di delimitazione sono ciò che consente a uno strumento di disegnare quell’evidenziazione. I punteggi di fiducia sono ciò che consente a una pipeline automatizzata di contrassegnare le pagine che un essere umano dovrebbe guardare invece di indovinare silenziosamente. OCR 4.1 è disponibile in anteprima pubblica dal 16 luglio e costa € 3,50 per 1.000 pagine, o € 4,38 per 1.000 pagine con annotazioni strutturate, attraverso lo stesso endpoint /v1/ocr, con supporto dell’elaborazione batch.
Cosa sta realmente succedendo qui
La lettura dei documenti è il luogo in cui avviene effettivamente gran parte del vero lavoro dell’intelligenza artificiale, ben lontano dai titoli dei chatbot. Fatture, contratti, richieste di indennizzo assicurative, documenti scientifici, moduli governativi: tutto arriva come PDF e scansioni, e niente di tutto ciò è utile a un modello finché qualcuno non lo trasforma in testo strutturato. Il motivo per cui questo comunicato si basa così tanto su citazioni e fiducia è che il mercato ha imparato a proprie spese che una risposta dell’IA che nessuno può verificare è una risposta dell’IA a cui nessuno approverà. Mistral è un’azienda francese, che qui interessa ai lettori in modo pratico: la residenza europea dei dati è un’opzione normale piuttosto che una richiesta speciale. Due avvertimenti onesti: questo è ancora etichettato come anteprima pubblica e il prezzo è per pagina, quindi un archivio di grandi dimensioni si accumula rapidamente. Centomila pagine equivalgono a 350 euro.
Cosa significa per te: se hai uno scaffale pieno di documenti scansionati e ti chiedi se l’intelligenza artificiale possa finalmente farci qualcosa, questo è il livello che fa sì che funzioni. Probabilmente non utilizzerai direttamente l’API, ma gli strumenti per documenti che usi sono basati su servizi come questo e ora sai cosa chiedere loro: può mostrarmi da dove viene la risposta? Se non è possibile, fai più attenzione a ciò che ti dice.
Fonti
- Scheda modello OCR 4.1 (Mistral AI)
- Documentazione del processore OCR (Mistral AI)
- Mistral OCR 4: SOTA OCR per Document Intelligence (Mistral AI)
La nuova modalità ultraveloce di OpenAI esegue il suo modello migliore 14 volte più velocemente
Un nuovo livello API OpenAI basato su Cerebras esegue GPT-5.6 Sol fino a 750 token di output al secondo. Stesso modello, stessa qualità, circa quattordici volte la velocità, inizialmente per un piccolo gruppo di clienti.