CourionAI
ES
Boletín
← Todas las noticias
open-source 3 min de lectura

«Unlimited OCR» de Baidu lee documentos de 40 páginas de una sola vez aprendiendo a olvidar

Un nuevo modelo de código abierto de Baidu procesa decenas de páginas de documentos en una sola pasada manteniendo estable el uso de memoria y lidera OmniDocBench; los pesos y la demostración se pueden probar gratis.

Un documento plegado en acordeón atraviesa una imprenta que convierte sus páginas en filas ordenadas de puntos

Convertir documentos escaneados en texto útil, OCR, siglas en inglés de reconocimiento óptico de caracteres, es una de las tareas más prácticas de la IA. También ha tenido una limitación persistente: los modelos actuales se atascan cuando procesan más de unas diez páginas a la vez, porque la memoria necesaria crece con cada línea que generan. Investigadores de Baidu han presentado Unlimited OCR, un modelo de código abierto que lee decenas de páginas en una sola pasada mientras mantiene estable su consumo de memoria. Actualmente lidera la prueba documental OmniDocBench para sistemas completos con un 93,92 por ciento.

El truco resulta entrañablemente humano. Cuando copias a mano el texto de un libro, no vuelves a leer todo lo que ya has escrito: mantienes la vista en el original y en las últimas palabras anotadas, mientras los pasajes anteriores simplemente se desvanecen. Baidu incorporó ese principio al modelo: cada nuevo fragmento de salida puede consultar la imagen completa del documento, pero solo los últimos 128 tokens, aproximadamente, las últimas frases, de lo que él mismo ha escrito. El equipo lo llama Reference Sliding Window Attention. El resultado es que, en pruebas de más de 40 páginas, la tasa de error se mantiene baja y el modelo genera el contenido cerca de un 13 por ciento más rápido que el sistema DeepSeek OCR en el que se basa. La diferencia aumenta cuanto más largo es el documento.

¿Qué hay detrás? El OCR se ha convertido discretamente en uno de los ámbitos más competitivos de la IA, y no solo para leer contratos. El texto almacenado como imagen requiere mucha menos capacidad de cálculo que ese mismo texto convertido en tokens. Por eso, los laboratorios consideran que la tecnología de lectura de documentos puede ofrecer a los modelos de lenguaje una memoria más larga y barata. Es la misma idea que sustenta pxpipe, la herramienta que analizamos la semana pasada y que reduce el coste en tokens al convertir las instrucciones en archivos PNG. Una salvedad razonable: «ilimitado» exagera un poco. El contexto fijo de 32.000 tokens del modelo sigue limitando cuántas páginas caben en una pasada, y los caracteres muy pequeños le plantean problemas. Baidu afirma que prepara versiones con 128.000 tokens.

Qué significa esto para ti: Este sí puedes probarlo hoy: el código y los pesos del modelo están disponibles gratis en GitHub y Hugging Face, y existe una demostración en el navegador mediante Hugging Face Spaces que no exige ninguna instalación. Si trabajas habitualmente para convertir en texto PDF escaneados, facturas o archivos antiguos en papel, la mejor tecnología disponible acaba de volverse más rápida, capaz de manejar documentos más largos y gratuita. Para el público más técnico: tiene 3.000 millones de parámetros, de los que solo unos 500 millones están activos, así que es lo bastante pequeño para funcionar en equipos modestos. Es una herramienta local realmente útil, no solo un titular de pruebas de rendimiento.

Fuentes

Fuentes: https://github.com/baidu/Unlimited-OCR

Siguiente artículo

Un clásico de PC de 2003 en tu iPhone: la IA adapta Command & Conquer a iOS en un fin de semana

Un diseñador de Google DeepMind utilizó Claude Code y Fable 5 para adaptar Command & Conquer: Generals Zero Hour a iOS nativo; obtuvo la primera versión jugable en unos 40 minutos y publicó todo el código en GitHub.

Un tanque retro y una antena de radar emergen de la pantalla de un smartphone bajo nubes de pixel art