Riconoscimento ottico dei caratteri
La tecnologia che trasforma immagini di testo, scansioni, foto e PDF in dati modificabili e ricercabili.
Il riconoscimento ottico dei caratteri, o OCR, è la tecnologia che legge testo dalle immagini, come una pagina scansionata, la foto di uno scontrino o un PDF, e lo trasforma in testo digitale che un computer può cercare ed elaborare. Esiste da decenni, ma l’IA moderna lo ha reso molto più capace.
L’OCR basato sull’IA oggi non si limita a copiare parole. I modelli migliori restituiscono una mappa strutturata del documento: dove si trova ogni blocco, se è un titolo, una tabella o una firma e quanto il modello è sicuro. Alcuni possono leggere decine di pagine in un solo passaggio.
L’OCR è una delle applicazioni aziendali più utili e meno pubblicizzate dell’IA: trasforma fatture, contratti e archivi in dati strutturati. Soprattutto, diversi ottimi modelli OCR possono funzionare in locale, così i documenti sensibili non devono mai lasciare i propri sistemi.
-
Mistral OCR 4.1 ora può indicare il paragrafo esatto letto
-
I modelli piccoli leggono i vecchi libri meglio di quelli grandi, e costa due dollari per mille pagine
-
Microsoft e Mistral si alleano per costruire l’IA in Europa e mantenervi i dati
-
“Unlimited OCR” di Baidu legge documenti di 40 pagine in una volta sola, imparando a dimenticare
-
Questo strumento open source nasconde il testo nelle immagini per ridurre fino al 70% il costo di Claude