ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

OCRmyPDF 完整实操指南:一条命令让扫描 PDF 变成可搜索文件

OCRmyPDF 完整实操指南:一条命令让扫描 PDF 变成可搜索文件 OCRmyPDF 完整实操指南一条命令让扫描 PDF 变成可搜索文件【免费下载链接】OCRmyPDFOCRmyPDF adds an OCR text layer to scanned PDF files, allowing them to be searched项目地址: https://gitcode.com/GitHub_Trending/oc/OCRmyPDF手里的扫描 PDF 怎么都搜不到字复制粘贴出来的全是乱码或空行问题在于扫描件本质上是一张张图片里面根本没有文字。OCRmyPDF 用 Tesseract 引擎在图片底下垫一层文字页面外观不变从此能搜索、能复制、还能按 PDF/A 标准长期归档。它到底在干什么一句话定位OCRmyPDF 是一个命令行工具把扫描件 PDF或图片转成带隐藏文字层的可搜索 PDF/A。核心能力就四件垫文字层OCR 识别结果精确压在原文位置下方复制粘贴不乱序原样保留不改动嵌入图片的分辨率能无损插入文本层不破坏其他内容自动修复可选纠斜deskew、清污clean、纠正页面旋转并行处理默认吃满所有 CPU 核心几千页的文件也能跑完装好它环境要求一行带过支持 Linux / macOS / WindowsWSL依赖 Tesseract 和 Ghostscript包管理器会自动带上。最省事的两种装法# Debian / Ubuntu / WSL sudo apt install ocrmypdf # macOSHomebrew brew install ocrmypdf装完ocrmypdf --version能输出版本号就算好了。其他发行版和源码安装方式见官方文档 docs/installation.md。跑通第一条命令 这节解决装好了第一步干什么的问题。最小可用示例就一条ocrmypdf input.pdf output.pdf输入什么 → 得到什么输入一个扫描件 PDF得到一个同外观但可全文检索的 PDF/A 文件。跑的时候终端里会按阶段刷进度条扫描、OCR、PDF/A 转换、图像压缩最后一行会告诉你压缩率——不少情况输出文件反而比输入还小。一个容易忘的技巧输入输出写成同一个文件名就可以原地处理失败时不会覆盖原文件ocrmypdf myfile.pdf myfile.pdf参数怎么配高频参数速查每行附一句什么时候用它参数作用什么时候用它-l eng指定识别语言多语言用拼如-l chi_simeng文件里有非英文文字时必改否则识别率掉得厉害--rotate-pages自动纠正页面方向扫描件里横竖页混在一起方向歪了--deskew纠正轻微倾斜扫描时放歪了几度页面整体斜--cleanOCR 前清理页面扫描质量差有斑点、灰底、污渍--skip-text跳过已有文字的页面大文件里只有部分是扫描件省时间--oversample 600按 600 DPI 重新采样识别原图模糊偏小需要放大后再识别--jobs 1限制并发数多核机器内存吃紧、任务被 OOM 杀掉时--output-type pdfa输出 PDF/A 归档格式默认值需要长期存档时保持不动完整参数清单看ocrmypdf --help细节见 docs/cookbook.md。效率倍增器批量处理一整目录解决几十个文件手敲几十次的问题。仓库里自带的misc/batch.py就是一个现成脚本docs/batch.md 有说明不想看脚本的话shell 一行循环也行for f in *.pdf; do ocrmypdf $f ocr_$f; done配置一次到处复用解决每个命令后面拖一长串参数的问题。把常用项写进配置文件以后只带--configlanguage eng rotate-pages True deskew Trueocrmypdf --config my.conf input.pdf output.pdf识别不准先查质量链路解决识别率低的问题。按顺序调先装对语言包如中文tesseract-ocr-chi-sim→ 页面脏就加--clean→ 图太糊就加--oversample 600。三步走完还不行多半是扫描分辨率本身不够回扫描仪加到 300 DPI 以上重扫。这些场景直接能用老文档、打字机稿数字化几十年前的打字机稿、影印资料最怕的是看得见但搜不着。跑一遍 OCRmyPDF原文外观不动底下的文字层让你直接 CtrlF。识别结果作为可搜索 PDF/A 存进档案引用检索都方便。地图类文档加文字索引地图、工程图上文字散布在图形里普通 OCR 工具容易把图当噪声丢掉。OCRmyPDF 只垫文字层不重画图像地名、图例都能搜到线条和色块完全不受影响。归档前的批量压缩扫描进档案前文件往往又大又杂。用上面配置一次到处复用的方式给整批文件统一加--optimize 2图像优化后输出普遍比输入小一半示例运行里压缩率约 54%同时得到长期存档用的 PDF/A-2。遇到问题先看这里问题解法中文/日文识别出来是乱码装对应语言包如sudo apt install tesseract-ocr-chi-sim并加-l chi_sim大文件处理到一半被系统杀掉OOM加--jobs 1降到单核或用--pages 1-50分段跑复制出来的文字对不上位置确认没走--skip-text检查原文是否已有错位文字层必要时加--redo-ocr页面方向是歪的加--rotate-pages只是轻微斜则改用--deskew两个不冲突输出文件比预期大加--optimize 2 --jpeg-quality 60让优化器压 JPEG报错细节和退出码含义见 docs/errors.md。一条ocrmypdf 输入.pdf 输出.pdf就能让扫描件从一堆图片变成可搜索、可归档的 PDF/A批量、配置文件和--clean/--oversample再帮你把质量拉满。想深入看参数和行为细节读官方文档 docs/index.md插件机制并发、图像优化、Tesseract 接口的源码都在 src/ocrmypdf/builtin_plugins/。【免费下载链接】OCRmyPDFOCRmyPDF adds an OCR text layer to scanned PDF files, allowing them to be searched项目地址: https://gitcode.com/GitHub_Trending/oc/OCRmyPDF创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表