
OCRmyPDF 完整指南3 条命令给扫描 PDF 加上可搜索文本层【免费下载链接】OCRmyPDFOCRmyPDF adds an OCR text layer to scanned PDF files, allowing them to be searched项目地址: https://gitcode.com/GitHub_Trending/oc/OCRmyPDFOCRmyPDF 是一个开源命令行工具给扫描版 PDF 添加 OCR 识别的文本层让原本只能看图的文件变成可搜索、可复制文字的可搜索 PDF。适合需要数字化扫描件、处理归档文档的工程师、档案管理员和普通用户。先跑起来一条命令完成第一次转换装好就能用。Debian/Ubuntu 用户一条命令搞定sudo apt install ocrmypdf其他平台可以pip install ocrmypdfmacOS/Linux 也可以用brew install ocrmypdf。装完先确认一下ocrmypdf --version然后跑一条最短的真实转换命令ocrmypdf 扫描版.pdf 输出.pdf处理完成后在任意 PDF 阅读器里选中、搜索文字就都能用了版面外观保持不变。注意 pip 装的是 Python 部分Tesseract 等外部依赖需要用系统包管理器单独装。参数工具箱高频参数一张表参数不用背用到时查这张表参数作用什么场景用-l engfra指定识别语言多语言用连接非英文文档或中英混排-d/--deskewOCR 前校正页面倾斜扫描件歪了行斜得搜不准-c/--clean用 unpaper 清理扫描噪点、杂斑扫描质量差、背景脏-r/--rotate-pages按文字方向自动旋转页面横竖页混扫、页面倒置--oversample 600把低分辨率图像超采样到指定 DPI300dpi 以下模糊扫描件--output-type pdfa输出 PDF/A 长期存档格式归档、合规存档--optimize 2启用有损压缩明显减小体积文件太大、要上传或存储-s/--skip-text跳过已有文字的页面文档图文混排只补图片页-j N限制并行 CPU 核心数批量处理时防止机器过热--sidecar 输出.txt额外导出一份纯文本建全文检索索引、先预览识别质量真实场景怎么做多语言混排文档-l 一次指定多种语言Tesseract 无法自动判断语言你必须告诉它。先装好对应语言包再一起声明ocrmypdf -l chi_simeng 合同扫描件.pdf 合同可搜索.pdf语言包安装示例sudo apt install tesseract-ocr-chi-sim用tesseract --list-langs查看已装列表。一条命令批量转换整个文件夹仓库文档 docs/batch.md 推荐用 GNU parallel 做批处理限制 2 个并发避免机器过载parallel --tag -j 2 ocrmypdf {} output/{} ::: *.pdf只想原地更新、逐文件串行跑也可以find . -name *.pdf -exec ocrmypdf {} {} \;图文混排、已有文字层选对处理模式文档里一部分页是图片、一部分页已有文字时默认模式会直接报错。用-s跳过文字页想连已有文字一起重新识别用--force-ocr只想给指定页做 OCR用--pages 3-end只处理第 3 页到最后一页。它是怎么工作的OCRmyPDF 把每页 PDF 渲染成图像交给 Tesseract 识别出文字和位置坐标再把文字按原位置嵌入为不可见文本层最后做图像压缩和 PDF/A 转换输出。整个过程原始版面不动只是多了一层藏在图底下的字。遇到问题怎么办现象中文全识别成乱码。原因默认按英文eng识别语言不对时结果会非常差。 解决装中文语言包后用-l chi_sim重新处理。现象报错说文件已包含文字处理中断。原因默认--mode default遇到已有文本层会拒绝继续防止覆盖。 解决图文混排用-s跳过文字页确认要重做用--force-ocr。现象输出文件比原文件还大。原因嵌入文本层占空间且默认优化等级-O1只做无损压缩。 解决加--optimize 2或--optimize 3黑白为主的文档装上 jbig2enc 编码器收益更大。现象提示找不到 unpaper--clean失败。原因unpaper 是可选外部依赖没装。 解决sudo apt install unpaper或者去掉--clean参数。现象页面歪斜或倒置搜索命中很怪。原因没做预处理文字方向没校正。 解决加-d -r先纠斜再旋转。和其他工具怎么选OCRmyPDFTesseract 命令行在线 OCR 服务商业 PDF 软件免费开源是是部分免费否直接输出可搜索 PDF是有限视服务而定是PDF/A 存档是否否部分图像预处理纠斜/清洁内置无无有限压缩优化内置无无有限无界面可脚本化是是否否结论如果你只要识别一句话Tesseract 就够如果你要的是批量产出可搜索、可归档、体积可控的 PDFOCRmyPDF 是命令行工具里功能最完整的选择。总结OCRmyPDF 用一条命令就能给扫描 PDF 加文本层再配上-l、--deskew、--optimize等参数覆盖绝大多数数字化场景。下一步建议读 docs/cookbook.md 看更多命令组合想深入内部可以看 src/ocrmypdf/ 源码和 src/ocrmypdf/builtin_plugins/ 里的插件实现。【免费下载链接】OCRmyPDFOCRmyPDF adds an OCR text layer to scanned PDF files, allowing them to be searched项目地址: https://gitcode.com/GitHub_Trending/oc/OCRmyPDF创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考