ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

OCRmyPDF 免费OCR教程:把扫描PDF变成可搜索文档,一条命令搞定

OCRmyPDF 免费OCR教程:把扫描PDF变成可搜索文档,一条命令搞定 OCRmyPDF 免费OCR教程把扫描PDF变成可搜索文档一条命令搞定【免费下载链接】OCRmyPDFOCRmyPDF adds an OCR text layer to scanned PDF files, allowing them to be searched项目地址: https://gitcode.com/GitHub_Trending/oc/OCRmyPDFOCRmyPDF 是一款免费开源的命令行工具专门给扫描件做 OCR光学字符识别也就是看图识字。它把扫描版 PDF 原封不动保留只在图像下方垫一层隐藏文字——文件不变、体积不涨但从此能搜索、能复制。全程在本机离线跑文件不用上传支持 100 多种语言。扫描件搜不到字问题出在这你遇到过这种情况吗一份几百页的扫描文献CtrlF搜个关键词毫无反应想复制一句话只能手打。在线 OCR 服务能解决搜索但文件要先上传到别人服务器画质还常被压缩手机拍照识字则是一张一张来没法批处理。OCRmyPDF 走的是另一条路对比项在线 OCR 服务手机拍照识字OCRmyPDF数据位置上传对方服务器上传云端全程本地文件不出机器画质常被重压缩受拍照质量限制保留原始嵌入分辨率费用按量收费限次数免费开源批量能力一次一个一张一张拍多页多文件排队处理装好环境1分钟跑通第一条命令三个系统各一条安装命令装完即用底层会带上 Tesseract 识别引擎和 Ghostscript 等依赖pip install ocrmypdf # Windows另需装 Tesseract 和 Ghostscript brew install ocrmypdf # macOS sudo apt install ocrmypdf # Debian / Ubuntu然后运行第一条 OCR 命令ocrmypdf 扫描.pdf 输出.pdf # 第一个是输入第二个是输出文件跑完打开输出文件验证CtrlF搜一个词能命中、选中文字能正常复制说明文本层已经加上。输出默认是 PDF/A 归档格式适合长期保存。处理过程长这样高频调参3个开关让识别更准更快语言选对识别才准。默认按英文识别中文、法文等文档必须先声明语言否则错字连篇ocrmypdf --language chi_simeng 文档.pdf 输出.pdf # 中英混排两种语言一起识别歪斜和脏污先摆正再识别。扫描件常整页倾斜、带阴影噪点两个开关开启预处理ocrmypdf --deskew --clean-final 歪斜.pdf 输出.pdf # deskew 摆正页面clean-final 去噪点页数多就开多核并行。这个参数把各页分给多个 CPU 核心同时处理4 核机器写 4ocrmypdf --jobs 4 大文件.pdf 输出.pdf # 并行数写成核心数两个真实任务组合拳学术文献批处理扫描论文页码多、常中英混排语言开双轨并行拉满晚上挂机正合适ocrmypdf --language chi_simeng --jobs 4 论文扫描.pdf 论文_可搜索.pdf只处理前 50 页几十上百页的大文件容易吃满内存用--pages按页码区间切着来ocrmypdf --pages 1-50 大文件.pdf 部分1.pdf # 只处理第1到50页报错急救速查报错现象原因一条命令解决提示缺少语言包对应 Tesseract 语言包没装sudo apt-get install tesseract-ocr-chi-sim大文件内存不足整份文件一次载入ocrmypdf --pages 1-50 大文件.pdf 部分1.pdf处理速度偏慢没开并行或并行数太少ocrmypdf --jobs 4 文档.pdf 输出.pdf提示缺 unpaper--clean-final依赖没装sudo apt install unpaper想深入看看所有参数的完整说明在仓库文档 docs/ 里安装细节、Docker 用法都有覆盖想自定义识别流程可以翻翻 src/ocrmypdf/builtin_plugins/ 里内置插件的实现每个插件对应一类识别或优化能力。【免费下载链接】OCRmyPDFOCRmyPDF adds an OCR text layer to scanned PDF files, allowing them to be searched项目地址: https://gitcode.com/GitHub_Trending/oc/OCRmyPDF创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表