CourionAI
IT
Newsletter
← Tutte le notizie
open-source 2 min di lettura

“Unlimited OCR” di Baidu legge documenti di 40 pagine in una volta sola, imparando a dimenticare

Un nuovo modello open source di Baidu elabora decine di pagine di documenti in un unico passaggio mantenendo costante l’uso della memoria, guida la classifica OmniDocBench ed è disponibile gratuitamente con pesi e demo.

Un documento piegato a fisarmonica attraversa una macchina da stampa che trasforma le pagine in file ordinate di punti

Trasformare documenti scansionati in testo utilizzabile, l’OCR, abbreviazione di riconoscimento ottico dei caratteri, è uno dei lavori più pratici dell’IA. Ma presenta anche un limite ostinato: i modelli attuali vanno in crisi dopo una decina di pagine per volta, perché la memoria occupata cresce con ogni riga prodotta. I ricercatori di Baidu hanno ora pubblicato Unlimited OCR, un modello open source che legge decine di pagine in un unico passaggio mantenendo costante l’uso della memoria e che attualmente guida il benchmark documentale OmniDocBench per i sistemi end-to-end, con il 93,92 percento.

Il trucco è deliziosamente umano. Quando copi a mano il testo di un libro, non rileggi tutto ciò che hai già scritto: tieni gli occhi sulla fonte e sulle ultime parole annotate, mentre i passaggi precedenti semplicemente sfumano. Baidu ha inserito questo comportamento nel modello: ogni nuova porzione di output può vedere l’intera immagine del documento, ma soltanto gli ultimi 128 token, all’incirca le ultime frasi, della propria scrittura. Il team lo chiama Reference Sliding Window Attention. Il risultato: nei test oltre le 40 pagine, il tasso di errore resta basso e il modello genera testo circa il 13 percento più velocemente del sistema DeepSeek OCR su cui si basa, con un distacco che aumenta all’allungarsi del documento.

Che cosa c’è dietro? L’OCR è diventato silenziosamente uno dei settori più competitivi dell’IA, e non soltanto per leggere contratti. Il testo conservato come immagine richiede molta meno capacità di calcolo rispetto allo stesso testo sotto forma di token, perciò i laboratori considerano la tecnologia di lettura dei documenti un modo per offrire ai modelli linguistici una memoria più lunga e meno costosa: è la stessa idea alla base dello strumento pxpipe di cui abbiamo scritto la scorsa settimana, che riduce il costo dei token trasformando i prompt in PNG. Una precisazione doverosa: definirlo «illimitato» è un po’ eccessivo. La finestra di contesto fissa da 32.000 token continua a porre un limite al numero di pagine elaborabili in un solo passaggio e i caratteri molto piccoli mettono in difficoltà il modello. Baidu afferma che sono previste versioni da 128.000 token.

Cosa significa per te: Questo puoi provarlo davvero già oggi: il codice e i pesi del modello sono disponibili gratuitamente su GitHub e Hugging Face, mentre su Hugging Face Spaces c’è una demo accessibile dal browser che non richiede alcuna configurazione. Se ti capita spesso di dover trasformare in testo PDF scansionati, fatture o vecchi archivi cartacei, lo stato dell’arte è appena diventato più veloce, capace di gestire documenti più lunghi e gratuito. Per i lettori più tecnici: con 3 miliardi di parametri, dei quali soltanto circa 500 milioni attivi, il modello è abbastanza piccolo da funzionare su hardware non particolarmente potente, uno strumento locale davvero utile, non solo un titolo da benchmark.

Fonti

Fonti: https://github.com/baidu/Unlimited-OCR

Articolo successivo

Un classico per PC del 2003 sul tuo iPhone: l’IA ha portato Command & Conquer su iOS in un fine settimana

Un designer di Google DeepMind ha usato Claude Code e Fable 5 per portare Command & Conquer: Generals Zero Hour nativamente su iOS: la prima build giocabile è arrivata in circa 40 minuti e tutto il codice sorgente è su GitHub.

Un carro armato retrò e un’antenna radar emergono dallo schermo di uno smartphone sotto nuvole in pixel art