CourionAI
FR
Newsletter
← Toutes les actus
ai-basics 3 min de lecture

Les petits modèles lisent mieux les vieux livres que les grands, et cela coûte deux dollars pour mille pages

Hugging Face et EleutherAI ont testé 14 modèles de reconnaissance de texte ouvert sur des pages historiques. Le gagnant possède 3 milliards de paramètres et bat un modèle trois fois plus grand.

Un vieux livre ouvert avec des marques floues, une petite lentille corail planant au-dessus tandis qu'une grande lentille ornée est abandonnée

Voici un problème dont vous ne devineriez pas qu’il freinait l’IA : le texte des vieux livres est mauvais. Il y a des années, les bibliothèques ont numérisé des millions de volumes du domaine public et les ont analysés grâce à la reconnaissance optique de caractères, un logiciel qui transforme l’image d’une page en lettres. Les résultats sont pleins d’erreurs et les modèles formés sur ce texte apprennent mal. Un projet l’a mesuré : un modèle de langage formé sur d’anciens textes lus par machine n’a appris qu’à 30 % de l’efficacité d’un modèle formé sur les mêmes livres transcrits par des humains.

FineBooks, un effort conjoint de Hugging Face et EleutherAI, a cherché à vérifier si les modèles ouverts d’aujourd’hui pouvaient résoudre ce problème. L’équipe a exécuté 14 modèles de reconnaissance de texte librement disponibles sur 2 165 pages de livres historiques et a publié les résultats sous forme de classement public. Le meilleur modèle, dots.mocr, lit correctement 97,6 % des caractères à 1,94 dollars pour mille pages. Tous les 14 fonctionnent sur du matériel local, aucune API key n’est requise.

La surprise est de savoir quels modèles ont gagné. dots.mocr possède 3 milliards de paramètres, les nombres internes qu’un modèle apprend pendant la formation et un indicateur approximatif de la taille. Qwen3.5-9B est plus de trois fois plus grand et obtient un score inférieur, à 94,9 pour cent. La deuxième place revient à OvisOCR2 avec 0,9 milliard de paramètres, une précision de 96,9 % et 46 cents pour mille pages. Pour lire des livres anciens, la taille et la qualité ne font tout simplement pas bon ménage.

L’équipe fait attention à ce que couvrent les chiffres. Le test utilise uniquement les polices Antiqua en anglais, français, allemand et latin, sur des pages à une seule colonne. Pas de Fraktur, pas d’écritures non latines, pas d’écriture manuscrite. La vérité terrain provient de six volumes transcrits par des experts entre 2011 et 2012 avec environ une erreur pour 2 000 caractères. Et le verdict est partagé selon les objectifs : assez bon pour les données de formation de l’IA, pas assez bon pour l’érudition, car les modèles modernisent discrètement les caractères archaïques tels que les longs plutôt que de mal les lire. Les bibliothèques ont un autre casse-tête : leurs systèmes attendent un format avec des coordonnées au niveau des mots, et ces modèles génèrent du Markdown simple.

Ce que cela signifie pour vous: si vous avez déjà numérisé un document et combattu le texte tronqué qui en sortait, la nouvelle pratique est que les modèles gratuits font désormais bien ce travail et fonctionnent sur votre propre ordinateur. Le point le plus large est plus agréable. FineBooks prévoit de retraiter environ 200 000 documents du domaine public provenant de la Bibliothèque du patrimoine de la biodiversité, qui contient plus de 64 millions de pages d’histoire naturelle, et de publier ouvertement le texte épuré. Il s’agit d’une amélioration discrète et peu glamour de la matière première à partir de laquelle chaque modèle ouvert est construit, et du genre de travail qui fait rarement l’objet d’un communiqué de presse.

Sources

Sources: https://huggingface.co/blog/finebooks/historical-books-ocr-leaderboard

Article suivant

Meta a mis un modèle 30B sur votre ordinateur portable et Zuckerberg a utilisé le lancement pour se battre

Muse Glimmer est téléchargeable gratuitement, fonctionne sur une seule carte graphique grand public et bat ses plus grands rivaux sur les tâches d'agent. L’essai qui l’accompagne est la partie la plus intéressante.

Une grande sphère de corail pressée à travers une machine à entonnoir et émergeant sous la forme d'un petit cube sur un bureau ordinaire