扫描版 PDF 怎么变成可搜索文字:OCR 准确率怎么提
判断扫描版 PDF 的类型、影响 OCR 准确率的关键因素、提高识别率的具体步骤,以及表格和版式的处理办法,全部在浏览器本地完成。
先确认你的 PDF 是三种里的哪一种
同样是选不中文字,原因可能完全不同,处理方式也不一样。用一个动作就能分开:用鼠标在页面上拖选,能选中文字的是文字版;选不中、拖出来是整块图片框的是纯扫描版;能选中但选出来的字是乱码或错位,那是做过 OCR 但质量很差的版本。
| 类型 | 拖选文字的结果 | 需要做什么 |
|---|---|---|
| 文字版 | 能正常选中和复制 | 不需要 OCR,直接复制或转格式 |
| 纯扫描版 | 选不中,只出现图片框 | 需要完整 OCR |
| OCR 质量差 | 能选中但错字多、位置乱 | 先删掉旧文字层,重新 OCR |
| 带印章的打印件 | 部分能选中 | 正常 OCR,印章区域可忽略 |
别对文字版 PDF 跑 OCR。识别过程会在页面上再叠一层文字,结果是复制出来两份重叠的乱码,还得额外清理。
识别率高低,八成由扫描质量决定
很多人把识别不准归咎于工具,实际上同一份文件在不同质量下,准确率能差三十个百分点以上。真正起作用的变量就那几个,而且大部分在扫描那一刻已经定了。
- 分辨率:正文扫描建议 300 DPI,最低不要低于 200。低于 150 时笔画粘连会明显拖垮识别。
- 倾斜:页面歪超过 2 度,识别就开始串行。扫描时贴紧边角,或在识别前做自动纠斜。
- 对比度:复印件发灰、背景有阴影时,阈值分不开字和底。适当提高对比度,让字黑底白。
- 字号:小于六号字的正文即使 300 DPI 也常有错字,这种情况只能人工校对。
- 语言设置:中英混排要选多语言模型,只选中文的话英文单词会被拆成拼音式的乱字。
提高准确率的实际操作步骤
顺序很重要。先修图再识别,比识别完再改错字省时间得多。
- 检查原文件的分辨率和倾斜。歪的先纠斜,模糊的尽量找更清晰的原件重扫。
- 调整亮度和对比度,让文字和背景分离干净,去掉扫描边缘的黑框。
- 选择正确的语言模型。中文文档选简体中文,含英文术语的选中英混合。
- 选择保留版式还是纯文本。要拿去改内容的选纯文本流,要存档对照原件的选保留版式。
- 先拿三页试跑,检查错字率和段落顺序,满意了再跑全文,避免整份跑完才发现设置错了。
- 识别完成后全文搜几个高频词验证,比如常见地名或术语,搜不到说明那页没识别上。
表格和版式怎么处理
表格是 OCR 最容易翻车的地方。识别引擎倾向按视觉行读文字,遇到跨行合并单元格、无线框表格,读出来的顺序常常是错乱的。
如果表格要拿去算数,不要用通用 OCR 的结果直接贴进 Excel。用专门的表格提取工具,它会按框线重建行列关系,导出后再核对一遍表头。
转成 Word 时也要注意:识别工具生成的 docx 往往用大量文本框还原位置,看起来和原件一样,实际一动就散。要改内容的话选纯文本模式导出,接受版式上的简化。
识别结果一定要和原件对读一遍,尤其涉及金额、日期、编号、人名。把 3 认成 8、把 0 认成 O 是高发错误,肉眼过一遍比任何校对工具都可靠。
识别完之后还能做什么
有了文字层,这份文件才真正变成可处理的对象。可以做全文搜索,几百页的合同也能瞬间定位到某个条款;可以把内容复制到表格里做统计;可以转成 Word 改写成新版本;还能加批注和书签,方便后面的人查阅。
如果文件要外发,记得检查一遍元数据。扫描和识别过程会写入软件名、设备名、处理时间,这些信息在文档属性里能看到,需要的话先清一遍再发出去。
文中提到的在线工具
以下工具全部在浏览器本地运行,文件不会上传到服务器。
常见问题
OCR 识别率大概能到多少?
清晰的 300 DPI 打印体中文文档,主流引擎的字符准确率在 98% 到 99.5% 之间,也就是一页三百字大约错一到六个字。手写体、印章压字、复印件发灰的情况会明显下降,可能到 80% 以下。所以涉及金额和编号的内容必须人工核对,不能直接用。
扫描件做 OCR 会不会很慢?
取决于页数和是否本地处理。本地处理时,普通办公电脑一页 A4 彩色扫描件的识别大约一到三秒,一百页在几分钟量级。走云端还要加上传输时间,大文件往往卡在上传这一步,家用宽带上行通常只有几兆每秒。
识别出来的文字为什么无法编辑?
因为你选了保留版式或图片层模式,得到的是带位置信息的文字层,可以搜索和复制,但编辑需要能改排版的格式。转成 Word 并选纯文本模式即可编辑,代价是原版式会简化,表格可能变成纯文本行。
扫描的是彩色公章文件,识别出来一堆乱码怎么办?
印章压在正文上会破坏笔画。处理方式是把印章区域排除在识别范围外,或者先做一次去底色让红色变浅再识别。印章本身没有文字识别价值,不必强求它识别正确,保证正文干净即可。