Reconocimiento óptico de caracteres
Tecnología que convierte imágenes de texto, escaneos, fotos y PDF, en datos editables y buscables.
El reconocimiento óptico de caracteres, u OCR, lee texto de imágenes, una página escaneada, la foto de un recibo o un PDF, y lo convierte en texto digital que el ordenador puede buscar y procesar. Existe desde hace décadas, pero la IA moderna lo ha vuelto mucho más capaz.
El OCR actual hace más que copiar palabras. Los mejores modelos devuelven un mapa estructurado: dónde está cada bloque, si es título, tabla o firma y con qué confianza lo reconoce. Algunos leen decenas de páginas de una vez.
Es una de las aplicaciones empresariales más útiles y menos publicitadas: convierte facturas, contratos y archivos en datos estructurados. Además, varios modelos potentes funcionan localmente para que los documentos sensibles no salgan de sistemas propios.
-
Mistral OCR 4.1 ahora puede señalar el párrafo exacto que lee
-
Los modelos pequeños leen libros antiguos mejor que los grandes y cuestan dos dólares por cada mil páginas
-
Microsoft y Mistral se alían para construir IA en Europa y mantener allí los datos
-
«Unlimited OCR» de Baidu lee documentos de 40 páginas de una sola vez aprendiendo a olvidar
-
Esta herramienta de código abierto oculta texto en imágenes para reducir hasta un 70 % la factura de Claude