CourionAI
ES
Boletín
← Todas las noticias
ai-basics 3 min de lectura

Los modelos pequeños leen libros antiguos mejor que los grandes y cuestan dos dólares por cada mil páginas

Hugging Face y EleutherAI probaron 14 modelos de reconocimiento de texto abierto en páginas históricas. El ganador tiene 3 mil millones de parámetros y supera a un modelo tres veces su tamaño.

Un viejo libro abierto con marcas borrosas, una pequeña lente de coral flotando sobre él mientras una gran lente ornamentada yace descartada

Aquí hay un problema que no imaginarías que está frenando a la IA: el texto de los libros antiguos es malo. Las bibliotecas escanearon millones de volúmenes de dominio público hace años y los procesaron mediante reconocimiento óptico de caracteres, el software que convierte la imagen de una página en letras. Los resultados están llenos de errores y los modelos entrenados con ese texto aprenden mal. Un proyecto lo midió: un modelo de lenguaje entrenado con textos antiguos leídos por máquinas aprendió con solo el 30 por ciento de la eficiencia de uno entrenado con los mismos libros transcritos por humanos.

FineBooks, un esfuerzo conjunto de Hugging Face y EleutherAI, se propuso comprobar si los modelos abiertos actuales pueden solucionar este problema. El equipo ejecutó 14 modelos de reconocimiento de texto disponibles abiertamente en 2165 páginas de libros históricos y publicó los resultados como una tabla de clasificación pública. El mejor modelo, dots.mocr, lee correctamente el 97,6 por ciento de los caracteres a 1,94 dólares por cada mil páginas. Los 14 se ejecutan en hardware local, no se requiere API key.

La sorpresa es qué modelos ganaron. dots.mocr tiene 3 mil millones de parámetros, los números internos que un modelo aprende durante el entrenamiento y un indicador aproximado del tamaño. Qwen3.5-9B es más de tres veces más grande y tiene una puntuación más baja, del 94,9 por ciento. El segundo lugar lo ocupa OvisOCR2 con 900 millones de parámetros, 96,9 por ciento de precisión y 46 centavos por cada mil páginas. Para leer libros antiguos, el tamaño y la calidad simplemente no coinciden.

El equipo tiene cuidado con lo que cubren los números. La prueba utiliza únicamente tipos de letra Antiqua en inglés, francés, alemán y latín, en páginas de una sola columna. Ni Fraktur, ni escrituras no latinas, ni escritura a mano. La verdad fundamental proviene de seis volúmenes transcritos por expertos entre 2011 y 2012 con aproximadamente un error por cada 2.000 caracteres. Y el veredicto se divide según el propósito: lo suficientemente bueno para los datos de entrenamiento de la IA, no lo suficientemente bueno para la erudición, porque los modelos modernizan silenciosamente caracteres arcaicos como las s largas en lugar de malinterpretarlos. Las bibliotecas tienen un dolor de cabeza aparte: sus sistemas esperan un formato con coordenadas a nivel de palabra, y estos modelos generan Markdown simple.

Qué significa esto para ti: si alguna vez escaneaste un documento y luchaste con el texto confuso que salió, la noticia práctica es que los modelos gratuitos ahora hacen bien este trabajo y se ejecutan en tu propia máquina. El punto más amplio es mejor. FineBooks planea reprocesar alrededor de 200.000 documentos de dominio público de la Biblioteca del Patrimonio de la Biodiversidad, que contiene más de 64 millones de páginas de historia natural, y publicar abiertamente el texto limpio. Se trata de una mejora silenciosa y poco glamorosa de la materia prima con la que se construye cada modelo abierto, y el tipo de trabajo que rara vez recibe un comunicado de prensa.

Fuentes

Fuentes: https://huggingface.co/blog/finebooks/historical-books-ocr-leaderboard

Siguiente artículo

La ayuda legal gratuita de IA suena genial hasta que todos la usan. Los tribunales británicos lo están descubriendo

Las solicitudes urgentes en los tribunales laborales del Reino Unido se han multiplicado por cien a medida que los trabajadores utilizan chatbots para redactar reclamaciones. Muchas presentaciones tienen cientos de páginas y citan leyes que no existen.

Una torre inestable de documentos en papel apilados se cierne sobre un pequeño escritorio vacío de la sala del tribunal, con páginas desparramadas por el suelo.