ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

300多张书页照片和500页扫描版PDF,用免费离线OCR两周变成可搜索的文字

300多张书页照片和500页扫描版PDF,用免费离线OCR两周变成可搜索的文字 300多张书页照片和500页扫描版PDF用免费离线OCR两周变成可搜索的文字【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片PDF文档识别排除水印/页眉页脚扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR上周我卡在一个问题上300多张扫描书页的照片加上一本没有文字层的500多页旧PDF想提取文字又不想把资料传到云端。最后靠一款叫 Umi-OCR 的免费离线OCR软件全部搞定识别全程在本机完成断网也能跑。这篇文章只讲我这两周的真实用法和踩过的坑。从下载到第一次截图识别文字5分钟跑通发行包下载下来是.7z压缩包或.7z.exe自解压包区别一句话前者需要解压软件后者直接双击就能解。解压完进文件夹双击Umi-OCR.exe启动首次打开会自动按系统语言显示对应界面我的电脑是中文所以不用动。主界面是一排标签页截图OCR、批量OCR、文档识别、二维码、全局设置。我的建议是先把右上角的锁点上锁定标签页日常操作就不会手滑关掉正在用的工作页。然后点开截图OCR页按预设快捷键屏幕上出现取景框框住目标松手右侧立刻出结果——到这一步基本就跑通了。顺带说一句这个项目代码全部开源介意隐私的人可以git clone https://gitcode.com/GitHub_Trending/um/Umi-OCR自己翻源码确认识别确实在本地完成不经过外部网络。把屏幕文字抠出来代码缩进和段落换行一个不丢截图识别是最高频的用法。我主要处理两种材料一种是代码截图行首缩进和行内空格是灵魂另一种是多栏排版的论文页面左右栏不能交叉错乱。操作路径很固定按快捷键框选、或者在别处复制图片直接粘贴、或者把本地图拖进窗口三选一。真正拉开差距的是排版解析方案。识别代码截图时我选单栏-保留缩进首行缩进、行内空格都照原样保留复制进编辑器不用重排读多栏论文就切到多栏-按自然段换行输出按阅读顺序排好。右侧记录栏支持划选多条一起复制这点很顺手。我当初踩过一个坑识别一张超长截图时后半段文字整段丢了。排查半天最后在批量页的设置里找到限制图像边长把数值调大才解决——长图默认会被裁切处理这个参数不显眼翻软件说明才能找到答案。批量图片文字识别300多张照片一次拖进去导出Excel单张截图只是热身。书页照片一张张截不现实批量OCR页的用法把图片全拖进任务列表点开始剩下的交给进度条。支持 jpg、png、webp、bmp、tif 等格式官方明确说没有数量上限我一次丢进去300多张是常规操作。这里有个藏在设置里的实用功能忽略区域。困扰我很久的是每张照片右上角都有拍摄时间水印不处理的话结果里混进一堆2024-05-12。在右栏设置进忽略区域编辑器按住右键把水印可能出现的位置框起来任务执行时这些区域整体跳过。跑完对比结果干净了一个量级几百张图省下来的清洗时间以小时计。导出格式支持 txt、jsonl、md、csvExcel四种。我给同事整理资料时导过一次 Excel图片对应关系自动列好直接省掉一步人工录入这个最实用。顺带说扫描版PDF提取文字、命令行接口和多语言 批量是量大扫描版PDF才是硬。那本500多页的书翻页等于看照片文档识别页把 pdf、xps、epub、mobi、fb2、cbz 丢进去做完OCR能输出双层可搜索PDF——原图在底透明文字浮在上面既能翻页看原貌又能全文搜索、划词复制。我把一个术语丢进搜索框几秒内相关段落全跳出来。几百页的书每页页眉页脚都有书名页码提前画好忽略框正文就不会被重复文字污染。几个大文件还能排队配合任务完成后自动关机睡前挂上就行。想自动化的人还有个冷门入口命令行和HTTP接口。HTTP服务默认开启之后终端里直接敲umi-ocr --screenshot # 截屏识别umi-ocr --path D:\photos # 批量处理文件夹结果可加 --output 存文件umi-ocr --qrcode_create 文本内容 D:\输出.png # 一句话生成二维码图片二维码页既能截图扫码、支持一图多码和19种码制也能反向输入文本生成二维码。界面本地化也做得细简体中文、繁体、英文、日文随系统自动切换全局设置里还能手动改接口文档都放在 docs/http/ 目录里。先说谁不适合手写体和低清老照片确实偏弱离线引擎的短板要如实说对手写体、低分辨率老照片的识别率确实比不了云端大厂的模型。如果你手里主要是手记照片、年代久远模糊严重的扫描件它的准确率会让你失望这种情况建议接受离线优先、精度次之或者对关键页人工校对一遍。我的判断是适合它的用户画像很清晰——资料见不得光、必须离线一次处理量在几十张以上要的是解压即用而不是注册登录。满足其中两条它就能站稳。简单说免费、开源、批量这三件事凑齐的离线OCR工具并不多而它三样都做到了而且还在持续维护。如果你手头也压着扫描件或截图10分钟能验证它值不值得留在你机器上下载发行包并解压 → 打开截图OCR页按快捷键框一块区域 → 把识别结果复制出来看看格式对不对。当第一段文字出现在右侧面板时你大概率会默默把收藏夹里那个在线OCR网站删掉。【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片PDF文档识别排除水印/页眉页脚扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表