Los modelos pequeños leen libros antiguos mejor que los grandes y cuestan dos dólares por cada mil páginas
Hugging Face y EleutherAI probaron 14 modelos de reconocimiento de texto abierto en páginas históricas. El ganador tiene 3 mil millones de parámetros y supera a un modelo tres veces su tamaño.
Aquí hay un problema que no imaginarías que está frenando a la IA: el texto de los libros antiguos es malo. Las bibliotecas escanearon millones de volúmenes de dominio público hace años y los procesaron mediante reconocimiento óptico de caracteres, el software que convierte la imagen de una página en letras. Los resultados están llenos de errores y los modelos entrenados con ese texto aprenden mal. Un proyecto lo midió: un modelo de lenguaje entrenado con textos antiguos leídos por máquinas aprendió con solo el 30 por ciento de la eficiencia de uno entrenado con los mismos libros transcritos por humanos.
FineBooks, un esfuerzo conjunto de Hugging Face y EleutherAI, se propuso comprobar si los modelos abiertos actuales pueden solucionar este problema. El equipo ejecutó 14 modelos de reconocimiento de texto disponibles abiertamente en 2165 páginas de libros históricos y publicó los resultados como una tabla de clasificación pública. El mejor modelo, dots.mocr, lee correctamente el 97,6 por ciento de los caracteres a 1,94 dólares por cada mil páginas. Los 14 se ejecutan en hardware local, no se requiere API key.
La sorpresa es qué modelos ganaron. dots.mocr tiene 3 mil millones de parámetros, los números internos que un modelo aprende durante el entrenamiento y un indicador aproximado del tamaño. Qwen3.5-9B es más de tres veces más grande y tiene una puntuación más baja, del 94,9 por ciento. El segundo lugar lo ocupa OvisOCR2 con 900 millones de parámetros, 96,9 por ciento de precisión y 46 centavos por cada mil páginas. Para leer libros antiguos, el tamaño y la calidad simplemente no coinciden.
El equipo tiene cuidado con lo que cubren los números. La prueba utiliza únicamente tipos de letra Antiqua en inglés, francés, alemán y latín, en páginas de una sola columna. Ni Fraktur, ni escrituras no latinas, ni escritura a mano. La verdad fundamental proviene de seis volúmenes transcritos por expertos entre 2011 y 2012 con aproximadamente un error por cada 2.000 caracteres. Y el veredicto se divide según el propósito: lo suficientemente bueno para los datos de entrenamiento de la IA, no lo suficientemente bueno para la erudición, porque los modelos modernizan silenciosamente caracteres arcaicos como las s largas en lugar de malinterpretarlos. Las bibliotecas tienen un dolor de cabeza aparte: sus sistemas esperan un formato con coordenadas a nivel de palabra, y estos modelos generan Markdown simple.
Qué significa esto para ti: si alguna vez escaneaste un documento y luchaste con el texto confuso que salió, la noticia práctica es que los modelos gratuitos ahora hacen bien este trabajo y se ejecutan en tu propia máquina. El punto más amplio es mejor. FineBooks planea reprocesar alrededor de 200.000 documentos de dominio público de la Biblioteca del Patrimonio de la Biodiversidad, que contiene más de 64 millones de páginas de historia natural, y publicar abiertamente el texto limpio. Se trata de una mejora silenciosa y poco glamorosa de la materia prima con la que se construye cada modelo abierto, y el tipo de trabajo que rara vez recibe un comunicado de prensa.
Fuentes
Fuentes: https://huggingface.co/blog/finebooks/historical-books-ocr-leaderboard
Meta puso un modelo 30B en su computadora portátil y Zuckerberg usó el lanzamiento para buscar pelea
Muse Glimmer se puede descargar gratis, se ejecuta en una única tarjeta gráfica de consumo y supera a rivales más grandes en tareas de agentes. El ensayo que lo acompaña es la parte más interesante.