I modelli piccoli leggono i vecchi libri meglio di quelli grandi, e costa due dollari per mille pagine
Hugging Face ed EleutherAI hanno testato 14 modelli di riconoscimento di testo aperto su pagine storiche. Il vincitore ha 3 miliardi di parametri e batte un modello tre volte più grande.
Ecco un problema che non immagineresti possa ostacolare l’intelligenza artificiale: il testo dei vecchi libri è pessimo. Anni fa le biblioteche scansionavano milioni di volumi di pubblico dominio e li eseguivano attraverso il riconoscimento ottico dei caratteri, il software che trasforma l’immagine di una pagina in lettere. I risultati sono pieni di errori e i modelli addestrati su quel testo imparano male. Un progetto lo ha misurato: un modello linguistico addestrato su vecchi testi letti da una macchina ha imparato con solo il 30% dell’efficienza di un modello addestrato sugli stessi libri trascritti dagli esseri umani.
FineBooks, uno sforzo congiunto di Hugging Face ed EleutherAI, ha deciso di verificare se i modelli aperti di oggi possono risolvere questo problema. Il team ha eseguito 14 modelli di riconoscimento del testo liberamente disponibili su 2.165 pagine di libri storici e ha pubblicato i risultati come classifica pubblica. Il modello migliore, dots.mocr, legge correttamente il 97,6% dei caratteri a 1,94 dollari per mille pagine. Tutti e 14 vengono eseguiti su hardware locale, non è richiesta alcuna API key.
La sorpresa è quali modelli hanno vinto. dots.mocr ha 3 miliardi di parametri, i numeri interni che un modello apprende durante l’addestramento e un proxy approssimativo delle dimensioni. Qwen3.5-9B è più di tre volte più grande e ottiene un punteggio inferiore, pari al 94,9%. Il secondo posto va a OvisOCR2 con 0,9 miliardi di parametri, precisione del 96,9% e 46 centesimi per mille pagine. Per la lettura di libri antichi, dimensioni e qualità semplicemente non vanno d’accordo.
La squadra è attenta a ciò che dicono i numeri. Il test utilizza solo caratteri Antiqua in inglese, francese, tedesco e latino, su pagine a colonna singola. Niente Fraktur, niente scritture non latine, niente grafia. La verità fondamentale proviene da sei volumi trascritti da esperti tra il 2011 e il 2012 con circa un errore ogni 2.000 caratteri. E il verdetto si divide in base allo scopo: abbastanza buono per i dati di addestramento dell’IA, non abbastanza buono per gli studi, perché i modelli modernizzano silenziosamente caratteri arcaici come le s lunghe invece di fraintenderli. Le biblioteche hanno un altro grattacapo: i loro sistemi si aspettano un formato con coordinate a livello di parola e questi modelli producono un semplice Markdown.
Cosa significa per te: se ti è mai capitato di scansionare un documento e di lottare con il testo confuso che ne risultava, la notizia pratica è che ora i modelli gratuiti svolgono bene questo lavoro e funzionano sul tuo computer. Il punto più ampio è più bello. FineBooks prevede di rielaborare circa 200.000 documenti di pubblico dominio dalla Biodiversity Heritage Library, che contiene oltre 64 milioni di pagine di storia naturale, e di rilasciare apertamente il testo pulito. Si tratta di un miglioramento silenzioso e poco affascinante della materia prima da cui è costruito ogni modello aperto e del tipo di lavoro che raramente riceve un comunicato stampa.
Fonti
Fonti: https://huggingface.co/blog/finebooks/historical-books-ocr-leaderboard
Meta ha messo un modello 30B sul tuo laptop e Zuckerberg ha utilizzato il lancio per combattere
Muse Glimmer può essere scaricato gratuitamente, funziona su un'unica scheda grafica consumer e batte i rivali più grandi nelle attività degli agenti. Il saggio allegato è la parte più interessante.