CourionAI
IT
Newsletter
← Tutte le notizie
ai-basics 3 min di lettura

I modelli piccoli leggono i vecchi libri meglio di quelli grandi, e costa due dollari per mille pagine

Hugging Face ed EleutherAI hanno testato 14 modelli di riconoscimento di testo aperto su pagine storiche. Il vincitore ha 3 miliardi di parametri e batte un modello tre volte più grande.

Un vecchio libro aperto con segni sfocati, una piccola lente di corallo sospesa sopra di esso mentre una grande lente decorata giace scartata

Ecco un problema che non immagineresti possa ostacolare l’intelligenza artificiale: il testo dei vecchi libri è pessimo. Anni fa le biblioteche scansionavano milioni di volumi di pubblico dominio e li eseguivano attraverso il riconoscimento ottico dei caratteri, il software che trasforma l’immagine di una pagina in lettere. I risultati sono pieni di errori e i modelli addestrati su quel testo imparano male. Un progetto lo ha misurato: un modello linguistico addestrato su vecchi testi letti da una macchina ha imparato con solo il 30% dell’efficienza di un modello addestrato sugli stessi libri trascritti dagli esseri umani.

FineBooks, uno sforzo congiunto di Hugging Face ed EleutherAI, ha deciso di verificare se i modelli aperti di oggi possono risolvere questo problema. Il team ha eseguito 14 modelli di riconoscimento del testo liberamente disponibili su 2.165 pagine di libri storici e ha pubblicato i risultati come classifica pubblica. Il modello migliore, dots.mocr, legge correttamente il 97,6% dei caratteri a 1,94 dollari per mille pagine. Tutti e 14 vengono eseguiti su hardware locale, non è richiesta alcuna API key.

La sorpresa è quali modelli hanno vinto. dots.mocr ha 3 miliardi di parametri, i numeri interni che un modello apprende durante l’addestramento e un proxy approssimativo delle dimensioni. Qwen3.5-9B è più di tre volte più grande e ottiene un punteggio inferiore, pari al 94,9%. Il secondo posto va a OvisOCR2 con 0,9 miliardi di parametri, precisione del 96,9% e 46 centesimi per mille pagine. Per la lettura di libri antichi, dimensioni e qualità semplicemente non vanno d’accordo.

La squadra è attenta a ciò che dicono i numeri. Il test utilizza solo caratteri Antiqua in inglese, francese, tedesco e latino, su pagine a colonna singola. Niente Fraktur, niente scritture non latine, niente grafia. La verità fondamentale proviene da sei volumi trascritti da esperti tra il 2011 e il 2012 con circa un errore ogni 2.000 caratteri. E il verdetto si divide in base allo scopo: abbastanza buono per i dati di addestramento dell’IA, non abbastanza buono per gli studi, perché i modelli modernizzano silenziosamente caratteri arcaici come le s lunghe invece di fraintenderli. Le biblioteche hanno un altro grattacapo: i loro sistemi si aspettano un formato con coordinate a livello di parola e questi modelli producono un semplice Markdown.

Cosa significa per te: se ti è mai capitato di scansionare un documento e di lottare con il testo confuso che ne risultava, la notizia pratica è che ora i modelli gratuiti svolgono bene questo lavoro e funzionano sul tuo computer. Il punto più ampio è più bello. FineBooks prevede di rielaborare circa 200.000 documenti di pubblico dominio dalla Biodiversity Heritage Library, che contiene oltre 64 milioni di pagine di storia naturale, e di rilasciare apertamente il testo pulito. Si tratta di un miglioramento silenzioso e poco affascinante della materia prima da cui è costruito ogni modello aperto e del tipo di lavoro che raramente riceve un comunicato stampa.

Fonti

Fonti: https://huggingface.co/blog/finebooks/historical-books-ocr-leaderboard

Articolo successivo

Meta ha messo un modello 30B sul tuo laptop e Zuckerberg ha utilizzato il lancio per combattere

Muse Glimmer può essere scaricato gratuitamente, funziona su un'unica scheda grafica consumer e batte i rivali più grandi nelle attività degli agenti. Il saggio allegato è la parte più interessante.

Una grande sfera di corallo premeva attraverso una macchina a imbuto ed emergeva come un piccolo cubo su una semplice scrivania