Beispielbeitrag: Wie OCR verändert, was „geschwärzt“ bedeutet

1. Januar 2026 · Technik · Vorname Nachname

← Zurück zum Blog

[Beispielinhalt] Ein großer Teil der Dokumente, die geschwärzt werden müssen, enthält überhaupt keinen echten Text – es sind Scans, Fotos von Papierformularen oder aus Bildern erzeugte PDFs. Ohne OCR sind diese Inhalte für eine automatische Erkennung schlicht unsichtbar.

Text, der kein Text ist

Für Menschen sieht eine gescannte Seite aus wie eine native PDF-Seite. Für Software ist sie nur ein Raster aus Pixeln, bis jemand die Textebene extrahiert. Wer diesen Schritt überspringt, lässt die Erkennung ins Leere laufen.

Wo Genauigkeit wirklich zählt

Bei sauberen, hochauflösenden Scans ist OCR-Genauigkeit ein gelöstes Problem. Schwierig wird es bei dem, was echte Dokumente liefern: schiefe Seiten, kontrastarme Kopien, Handschrift neben Gedrucktem und mehrspaltige Layouts.

Deshalb wird OCR unterschätzt, wenn man sie als bloßen Vorverarbeitungsschritt abhakt: Die Qualität dieses Schritts legt die Obergrenze dessen fest, was die Schwärzung danach überhaupt erfassen kann.