範例文章:OCR 如何改變「已遮蔽」的意義
2026年1月1日 · 技術 · 作者姓名
← 回到部落格
[範例內容] 需要遮蔽的文件中,有很大一部分根本不是原生文字——而是掃描檔、紙本表單的照片,或由圖片產生的 PDF。沒有 OCR,自動偵測工具根本「看不到」這些內容。
看起來是文字,其實不是
對人類讀者來說,掃描頁和原生 PDF 頁看起來沒有兩樣;但對軟體而言,在擷取出文字層之前,它只是一格一格的像素。跳過這一步,偵測工具就無從搜尋。
準確度真正重要的地方
對乾淨、高解析度的掃描檔來說,OCR 準確度早就不是問題。真正困難的,是現實文件常見的情況:歪斜的頁面、低對比的影印本、手寫與印刷混雜,以及多欄排版。
所以把 OCR 當成可有可無的前處理步驟,其實是低估了它——這一步的品質,決定了後續遮蔽步驟最多能抓到多少內容。