ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

扫描PDF变可搜索:OCRmyPDF 的 3 个高频任务一次讲清

扫描PDF变可搜索:OCRmyPDF 的 3 个高频任务一次讲清 扫描PDF变可搜索OCRmyPDF 的 3 个高频任务一次讲清【免费下载链接】OCRmyPDFOCRmyPDF adds an OCR text layer to scanned PDF files, allowing them to be searched项目地址: https://gitcode.com/GitHub_Trending/oc/OCRmyPDFOCRmyPDF 是面向扫描PDF做OCR的命令行工具它用 Tesseract 引擎识别页面文字把结果以隐形文本层叠在原图下方让你可以搜索、复制同时保留原始排版。如果你手里有一堆扫描件、老打字机页面或票据这篇教程能帮你 5 分钟跑通它。一页搜不到字的旧文档上图是一张老打字机排版的菜谱页。把它扫进PDF后它就变成一张大图片选不中文字、CtrlF 找不到词、想复制一段只能手动重打。OCRmyPDF 解决的就是这件事。处理完后这页上的文字可以正常搜索和复制外观仍和原扫描件一致。整个过程在本地完成文件不出你的机器。装好就能用最短安装路径Debian/Ubuntuapt install ocrmypdfmacOS 用户用brew install ocrmypdf即可包管理器会一并装好 Tesseract 引擎。想从源码构建的话git clone https://gitcode.com/GitHub_Trending/oc/OCRmyPDF 然后执行pip install .。装完先跑ocrmypdf --help全部参数和说明都在里面。最常用的 3 个任务单文件一条命令加可搜索文本层ocrmypdf -l eng input.pdf output.pdf-l eng告诉引擎文档语言是英语。输出默认是 PDF/A 文件PDF/A 是为长期归档设计的PDF标准子集并自动通过格式校验。上图是一次真实运行8 页并行处理全程显示进度条结尾报告输出文件是合规的 PDF/A-2B。混合内容--skip-text 跳过已有文本页有些PDF里部分页面已经有文本层。默认模式下OCRmyPDF 检测到已有文字会直接报错拒绝处理。加--skip-text就会跳过含文字的页、只识别纯图像页如果你想整页重新识别改用--force-ocr。批量处理find 一条命令扫全文件夹官方批量文档给出的就地处理写法文件本身既当输入也当输出只在成功时才覆盖原文件见 docs/batch.mdfind . -name *.pdf -exec ocrmypdf -l eng {} {} \;文件多时可用 GNU parallel 同时跑两个任务官方示例脚本在 misc/batch.py还带目录树遍历版本。⚠️ 3 个高频坑报错页面已包含文字原因默认模式检测到已有文本层拒绝覆盖。 解法--skip-text跳过文字页或--force-ocr强制整页重识别。识别乱码、文字错位原因扫描件模糊或没指定正确语言。 解法加--oversample 600提升识别分辨率并装对应语言包如中文简体apt-get install tesseract-ocr-chi-sim。大文件处理慢原因默认会分发到所有CPU核心并行大文件同时占内存。 解法用--pages 1-50只处理指定页码或用--jobs 1限制核心数。扫描文档数字化里最费事的可搜索文本层 归档格式这一步OCRmyPDF 用一条命令就解决了。想改行为或扩展功能可以读 src/ocrmypdf/builtin_plugins/ 里的内置插件实现完整参数说明在 docs/。【免费下载链接】OCRmyPDFOCRmyPDF adds an OCR text layer to scanned PDF files, allowing them to be searched项目地址: https://gitcode.com/GitHub_Trending/oc/OCRmyPDF创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表