Voorbeeldartikel: hoe OCR verandert wat ‘zwartgelakt’ betekent
1 januari 2026 · Techniek · Naam auteur
[Voorbeeldinhoud] Een groot deel van de documenten die zwartgelakt moeten worden, bevat helemaal geen echte tekst — het zijn scans, foto's van papieren formulieren of pdf's die uit een afbeelding zijn gemaakt. Zonder OCR is die inhoud voor een automatische herkenner niet eens zichtbaar.
Tekst die geen tekst is
Voor een mens ziet een gescande pagina er hetzelfde uit als een digitale pdf-pagina, maar voor software is het slechts een raster van pixels totdat iets de tekstlaag eruit haalt. Sla die stap over en de herkenner heeft niets om in te zoeken.
Waar nauwkeurigheid echt telt
Bij een schone scan in hoge resolutie is OCR-nauwkeurigheid een opgelost probleem. De lastige gevallen zijn de documenten uit de praktijk: scheve pagina's, kopieën met weinig contrast, handschrift tussen gedrukte tekst en indelingen met meerdere kolommen.
Daarom doe je OCR tekort als je het behandelt als een vinkje in de voorbewerking: de kwaliteit van die stap bepaalt het plafond van wat de zwartlakstap daarna kan vinden.