ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

Umi-OCR零基础实战:3个任务让你搞定截图、批量与PDF识别

Umi-OCR零基础实战:3个任务让你搞定截图、批量与PDF识别 Umi-OCR零基础实战3个任务让你搞定截图、批量与PDF识别【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片PDF文档识别排除水印/页眉页脚扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR先给你三句能直接带走的话屏幕上的字想复制按一下快捷键划个框文字立刻变成可编辑文本几百张截图和扫描件堆在文件夹里拖进去一次跑完导出成 txt、Excel 都能用的文件扫描版 PDF 复制不了识别一遍就能生成能搜索、能复制的双层 PDF。这套流程的主角是一款免费、开源、完全离线的 OCR 文字识别软件——Umi-OCR。这篇文章不打算给你长篇大论的功能说明书而是照真实办事路径写你遇到什么麻烦就翻到对应那节照着先给结果 → 最短路径 → 进阶技巧的顺序走。看完你会带走一套截图识别 → 批量识别 → PDF 识别的完整流程外加几张关键时刻救急的旋钮清单。你是否遇到过这样的情况想引用同事发来的扫描版合同里一句话全选、复制屏幕上冷冷地弹出一行无法从此 PDF 复制文字转头打开在线识别网站不是限大小就是限次数更糟的是这些敏感材料还得先上传到别人的服务器。这时候你缺的不是更好的网而是一把放在自己电脑里的本地文字剪刀。Umi-OCR 就是这把剪刀它把 OCR 引擎整个搬到你的电脑里本地运行、本地计算图片和文档都不离开你的硬盘——识别多少张、多大多小、什么时候用全由你说了算。先对号入座什么情况用它什么情况用别的你的场景用 Umi-OCR 这样做用别的会怎样常从截图、视频画面里摘文字快捷键划选即识别离线秒出在线网页工具限次数、要联网手头有一批扫描图要转成文字整批拖入一次跑完导出Excel一张张手敲或逐图在线识别扫描版 PDF 想搜索、想复制识别后导出双层可搜索PDFAdobe 付费功能或在线转换只是偶尔认一张图也能用但装个软件略显重手机自带识图就够用跑起来比想象中简单从项目发布页下载.7z压缩包或.7z.exe自解压包没装压缩软件就选自解压包解压到任意目录双击Umi-OCR.exeLinux 下运行umi-ocr.sh就能启动。不需要安装、不需要联网、不需要注册。第一次启动会自动跟随系统语言程序主体由多个标签页组成——截图 OCR、批量 OCR、文档识别、二维码、全局设置像浏览器标签栏一样想用哪个点哪个。启动前的小提醒软件内置了本地 OCR 引擎和运行库部分杀毒软件会误报建议把它加入白名单能省掉后续很多为什么闪退的烦恼。任务一把屏幕上的文字一秒变成可复制文本先给结果打开截图 OCR标签页按下快捷键唤起截图框在屏幕上划出目标区域识别结果立刻出现在右侧记录栏里选中就能 CtrlC 复制还能直接点进去改错字。最短达成路径打开软件切到截图 OCR标签页 → 按默认快捷键唤起截图框划选要识别的区域 → 松开鼠标结果即刻出现在右侧直接复制走人。进阶技巧不用截图也能识别在聊天窗口里复制一张图片回到 Umi-OCR 直接粘贴它照样帮你识别。结果可以二次整理右侧记录栏里能划选多条记录一起复制识别完顺手就能拼成你想要的格式。竖排文字也不怕排版解析会自动处理横排和竖排从右到左的文本顺序。遇到情况去改哪里截图时屏幕闪烁、界面错位多半是显卡渲染兼容问题。去全局设置 → 界面和外观 → 渲染器切换渲染方案或直接关闭硬件加速通常立刻就好。屏幕上的字能随手抓了。但要是撞上一整文件夹的扫描图一张张截屏就太亏了——这就进入第二个任务。任务二一口气处理几百张扫描图先给结果把图片拖进批量 OCR标签页的窗口点开始任务几百张图逐张出结果跑完后一次性导出成txt、jsonl、md 或 csvExcel 可直接打开四种格式。最短达成路径打开批量 OCR标签页把图片直接拖进窗口支持 jpg、png、webp、bmp、tif、tiff 等常见格式没有数量上限→ 点开始任务右侧逐张显示耗时、置信度和识别结果 → 跑完选好格式一键导出。进阶技巧晚上挂着跑批量任务支持完成后自动关机或待机睡前丢几百张图进去醒来直接拿结果。跑一半想歇会v2.1.2 起支持暂停任务只要软件不退出待机/休眠后还能接着跑。遇到情况去改哪里长图识别缺字、不完整去设置 → 文字识别 → 限制图像边长调高数值——注意别盲目放大原图过度放大会增加噪声反而降低准确率。内存占用偏高如果你在用 PaddleOCR 引擎v2.1.4 起默认把内存限制在系统总内存的一半以内还想压一压就去插件配置里调低线程数。让水印、页眉页脚一键隐身批量识别最烦的就是图片角落的水印、LOGO、页眉页脚每次都会混进结果里。在批量识别页右侧设置里进入忽略区域编辑器按住右键在图上画几个矩形框把这些讨厌文字可能出现的位置全部框住识别时自动排除。记住一个关键机制只有完全落在矩形框内部的整个文本块才会被忽略所以画框宁可大一点、包全一点漏框一次结果里就会混进一行杂音。图片这条路算是通了。可要是客户发来的是一整份扫描版 PDF 呢压轴任务来了。任务三让扫描版 PDF 变成能搜索、能复制的文档先给结果把扫描版 PDF 拖进文档识别标签页识别完成后导出为双层可搜索 PDF——外表跟原扫描件一模一样但里面的文字可以搜索、复制、划线。历史合同归档、论文数字化都靠它顶上。最短达成路径打开文档识别标签页把 PDF 拖进去这个标签页还支持 xps、epub、mobi、fb2、cbz 等格式→ 选择输出双层可搜索 PDF → 跑完后打开生成的文件试试 CtrlF 搜索你会回来感谢自己的。背后逻辑只有三步解析 → 识别 → 重组。PDF 先被拆开区分出本来就有的文本层和需要 OCR 的扫描图片层扫描图片交给本地引擎逐页识别最后按阅读顺序重新拼装。所以它默认会优先提取 PDF 自带的文本层速度快、零识别误差只有遇到纯扫描页才自动切到 OCR。你也可以主动选择整页强制 OCR或反过来只提取原文本。进阶技巧想要体积小、好编辑的文件v2.1.2 起支持输出单层纯文本 PDF。扫描件的页眉页脚同样可以用忽略区域排除还能按页码范围设置。文档任务也支持完成后自动关机/休眠大批量转换可以挂着跑。遇到情况去改哪里如果你手头的扫描件旋转过方向、识别后文字错位务必用最新版本——v2.1.5 已修复 PDF 页面旋转导致的文本错位问题版本演进记录都在 CHANGE_LOG.md。顺手拧两个旋钮排版乱、语言想换改哪里识别结果顺序串了、排版乱了OCR 引擎吐出来的文字经常是散装的谁先谁后要靠排版解析来排座位。两个最高频的救急答案识别代码截图排版全乱在排版方案里切到单栏-保留缩进能保住行首缩进和行中空格输出基本可读。配合截图 OCR 用简直是程序员福音。识别多栏论文顺序串行切到多栏-按自然段换行自动按段落断行。拿不准选哪个时直接选它就对了能覆盖大多数场景。界面语言想换成别的第一次启动会自动跟随系统语言手动切换去全局设置 → 语言/Language中文、繁体中文、英文、日文、俄语、葡萄牙语等都有。注意界面语言和识别语言库是两回事——前者管按钮菜单长什么样后者管 OCR 引擎认哪种文字。比如界面用中文、日常识别日文书籍二者完全可以自由搭配。顺带一提内置的二维码标签页还能扫描/生成二维码支持 19 种码制做小工具时顺手就能用上。想要更自动命令行和本地接口各看一眼对普通用户图形界面已经够用但如果你想把它嵌进自己的工作流它还留了两扇门命令行入口就是主程序本身。比如umi-ocr --screenshot --clip翻译成大白话就是截个屏识别结果直接进剪贴板。再比如umi-ocr --path D:/扫描件.png --output result.txt就是识别这张图结果写到这个文件里。完整指令见 命令行手册。HTTP 接口软件启动后会跑一个本地 HTTP 服务默认开启只监听本地环回、不经过物理网卡数据不会外泄开发者用几十行代码就能把上传图片 → 返回 JSON 识别结果封装进自己的自动化流程。接口文档在 docs/http/api_doc.md。收尾按你的身份对号入座如果你属于常和截图、论文打交道的学生或编辑建议先去试试截图 OCR 多栏-按自然段换行再把忽略区域用起来一天能省出半小时如果你属于要批量归档扫描件的行政或档案人员优先玩文档识别 → 双层可搜索 PDF一次归档等于给旧档案开了全文搜索如果你只是偶尔想抠个图里的字解压就能用平时放着也不占地方。图里的字从此不用再手敲——这就是 Umi-OCR 给你的答案。【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片PDF文档识别排除水印/页眉页脚扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表