示例文章:OCR 如何改变“已脱敏”的含义

2026年1月1日 · 技术 · 作者姓名

← 返回博客

[示例内容] 需要脱敏的文件里,有很大一部分根本不是原生文字——而是扫描件、纸质表格的照片,或者由图片生成的 PDF。没有 OCR,自动识别工具根本“看不见”这些内容。

看起来是文字,其实不是

对人来说,扫描页和原生 PDF 页看起来没什么两样;但对软件来说,在提取出文字层之前,它只是一格一格的像素。跳过这一步,识别工具就无从查找。

准确率真正要紧的地方

对于干净、高分辨率的扫描件,OCR 准确率早已不是难题。真正难的是现实中常见的文件:歪斜的页面、低对比度的复印件、手写与印刷混排,以及多栏排版。

所以,把 OCR 当成可有可无的预处理步骤,实在是低估了它——这一步的质量,决定了后续脱敏环节最多能抓住多少内容。