Optische Zeichenerkennung
Technologie, die Textbilder, Scans, Fotos oder PDFs, in bearbeitbare und durchsuchbare Daten verwandelt.
Optische Zeichenerkennung, kurz OCR, liest Text aus Bildern, einer eingescannten Seite, dem Foto eines Kassenbons oder einem PDF, und verwandelt ihn in digitalen Text, den ein Computer durchsuchen und verarbeiten kann. Die Technik gibt es seit Jahrzehnten, doch moderne KI hat sie deutlich leistungsfähiger gemacht.
Heutige KI-gestützte OCR schreibt nicht nur Wörter ab. Die besten Modelle liefern eine strukturierte Karte des Dokuments: wo jeder Block liegt, ob es sich um einen Titel, eine Tabelle oder eine Unterschrift handelt und wie sicher sich das Modell ist. Manche lesen Dutzende Seiten in einem einzigen Durchgang.
OCR gehört zu den nützlichsten und am wenigsten gehypten KI-Anwendungen für Unternehmen: Rechnungen, Verträge und Archive werden zu strukturierten Daten. Wichtig ist auch, dass mehrere leistungsfähige OCR-Modelle lokal laufen können. Sensible Dokumente müssen das eigene System also nie verlassen.
-
Microsoft und Mistral bauen gemeinsam KI in Europa und halten die Daten dort
-
KI-Textdetektoren versagen, wenn das Modell deinen Schreibstil nachahmt
-
Baidus „Unlimited OCR“ liest 40-seitige Dokumente in einem Durchgang, indem es zu vergessen lernt
-
Dieses Open-Source-Werkzeug versteckt Text in Bildern und senkt Claudes Kosten um bis zu 70 Prozent