ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

Umi-OCR 三分钟上手:离线OCR从截图到扫描件的全流程指南

Umi-OCR 三分钟上手:离线OCR从截图到扫描件的全流程指南 Umi-OCR 三分钟上手离线OCR从截图到扫描件的全流程指南【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片PDF文档识别排除水印/页眉页脚扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR很多人以为做 OCR 就得把图片传到在线识别网站其实这是最常见的误解——那种方式文件要先经过别人的服务器存多久、谁看过你说了不算。Umi-OCR 是一类完全不同的做法完全离线的 OCR 工具识别引擎整个装在你自己的电脑里图片不离开硬盘不注册、不限额、不上传。Umi-OCR 下载安装与启动三步跑起来Umi-OCR 是绿色软件装不装系统它都能跑。下载从项目发布页拿.7z压缩包电脑没装压缩软件就选.7z.exe自解压包双击自动解开。解压放到任意目录比如D:\Tools\Umi-OCR。注意路径别带中文和空格能省掉不少莫名其妙的兼容问题。启动Windows 双击Umi-OCR.exeLinux 运行umi-ocr.sh。首次启动该做什么两件事先把软件目录加进杀毒白名单。它内置本地识别引擎和运行库部分杀软会误报而误报拦截正是闪退最常见的来源。看一眼界面语言。首次启动会按系统语言自动切换想手动改随时去全局设置调整。主窗口由标签页组成截图OCR、批量OCR、文档识别、二维码、全局设置点哪个用哪个。标签栏左上角可切换窗口置顶右上角能锁定常用标签防止日常误触关掉。三个高频场景看量级选场景场景一屏幕上的字随手抓——截图OCR适合谁日常要从屏幕上摘抄一两段文字的人。量级一次一张高频零散。入口在哪打开截图OCR标签页。怎么操作按快捷键唤起截图框框住目标文字。不想截图也行——在别处复制一张图比如聊天窗口里的图回来直接粘贴照样识别。产出什么结果立刻出现在右侧记录栏。文字能直接手动修正错字还能划选多条记录一起复制顺手整理成想要的格式不用跳去别的编辑器。哪里容易踩坑竖排文字从右到左的栏由排版解析自动处理但前提是识别引擎支持该语言——识别外语书籍时先确认语言库已下载。场景二几百张图一次拖进来——本地批量OCR适合谁手里有一批图片要归档、建索引的人。量级几十到几百张一次任务跑完。入口在哪切到批量OCR标签页。怎么操作把图片直接拖进窗口jpg、png、webp、bmp、tif、tiff 等常见格式都收数量没有上限。点开始任务。产出什么右侧逐张显示文件耗时、置信度和识别结果。跑完可导出txt、jsonl、md、csv四种格式csv 用 Excel 直接打开。过夜挂机可以设任务完成后自动关机或待机v2.1.2 起支持暂停任务软件不退出待机后接着跑。哪里容易踩坑图片角落的水印、LOGO 每次都会混进结果。解法在下文调参清单的忽略区域一节批量识别前先画好框再开任务能省掉大量后期删杂音的时间。场景三扫描版PDF转可搜索文字——文档识别适合谁要数字化旧书、历史合同、扫描版论文的人。量级整份文档几十上百页一次处理。入口在哪文档识别标签页支持pdf、xps、epub、mobi、fb2、cbz六种格式。怎么操作拖入文件选提取模式直接开始。底层流程是解析引擎底层依赖 PyMuPDF先把文件拆成现成文本层和需要识别的图片层扫描页交给本地引擎逐页识别最后按阅读顺序重组。产出什么两个主打功能。一是双层可搜索 PDF——底层是原图、上层是透明文字外观和扫描件一模一样文字却能搜索、复制、划线公司归档、论文数字化直接顶用。二是单层纯文本 PDFv2.1.2 起支持体积小、好编辑。提取模式默认优先提取 PDF 自带文本层速度快、零识别误差纯扫描页才自动切 OCR也可以强制整页 OCR或反过来只提取原文本。哪里容易踩坑页眉页脚、页码每次都在结果里这里同样支持按页码范围设置忽略区域把它们排掉任务完成自动关机也一样可用。手头有旋转过方向的扫描件记得用最新版v2.1.5 修复了旋转页面文本错位。从能用到好用五项调参清单跑起来只是及格线。想让产出干净按这五项过一遍。忽略区域怎么画去掉水印和页眉页脚批量识别页右侧设置里打开忽略区域编辑器按住右键在图片上画多个矩形框框内区域识别时自动排除。必须记住的机制只有整个文本块完全落在框内才会被忽略而不是按单个字符删。所以画框的经验是宁大勿小——把水印可能出现的位置全部包住漏框一次结果里就多一行杂音。排版方案怎么选决定产出长什么样引擎吐出来的文字本来是散装的谁先谁后由排版解析安排。内置预设方案如下方案适用场景多栏-按自然段换行两栏/三栏的论文书籍最常用多栏-总是换行每行独立适合按行后续处理多栏-无换行整段强制合并成一行单栏-按自然段换行单栏文档段落自然断行单栏-保留缩进代码截图专用保住行首缩进不做处理引擎原始输出不整理拿不准就选多栏-按自然段换行覆盖面最广。代码截图切单栏-保留缩进缩进和行中空格基本保住配合截图识别非常省心。两套引擎识别不准先换引擎试内置Rapid-OCR兼容性好和PaddleOCR速度快一些两套引擎全局设置里随时切换。结论在前识别不准或报错先换引擎试往往比调别的参数见效快。界面语言和识别语言库别混为一谈界面语言管按钮菜单长什么样支持中文、繁体中文、英文、日文、俄语、葡萄牙语等由社区译者维护更新还会新增。路径全局设置 → 语言/Language。识别语言库管引擎认哪种文字在各标签页的文字识别设置里单独选或下载。两者完全独立界面用中文、日常识别日文书籍没问题。性能三开关长图、内存、闪烁长图大图识别不全去文字识别设置里调高限制图像边长。默认值是为平衡速度和内存像素特别大的长截图适当调高即可。注意别放大原图过度放大增加噪声反而降准确率。内存占用偏高v2.1.4 起 PaddleOCR 插件默认把内存限制在系统总内存的一半以内还想再压可在插件配置里调低线程数。截屏闪烁、界面错位显卡渲染兼容问题。全局设置 → 界面和外观 → 渲染器切换渲染方案或关闭硬件加速通常就解决。卡住了查这里 三类症状速查别逐条背报错先判断症状属于哪一类。结果不干净症状原因解法忽略区域画了没效果框不够大或画完忘了保存重画更大的框整个文本块完全在框内才生效然后保存配置长图识别缺胳膊少腿限制图像边长偏低在文字识别设置里调高该值不是放大原图代码截图排版全乱排版方案选错切单栏-保留缩进机器闹脾气症状原因解法截图时闪烁、界面错位显卡渲染兼容问题切换渲染器或关闭硬件加速文件夹几万个文件加载很卡超大文件夹加载压力v2.1.5 已优化异步加载机制等预览界面进度加载完再操作任务跑不完症状原因解法批量任务想中途休息早期版本不能停v2.1.2 起支持暂停任务软件不退出待机/休眠后可继续命令行没反应命令行靠本地 HTTP 服务做进程间通信确认全局设置里 HTTP 服务已开启默认开启仅监听本地环回数据不出机器命令行入口要用主程序Umi-OCR.exe备用启动器可能不支持进阶玩法 命令行、HTTP 接口与版本演进命令行模式入口就是主程序指令支持简写--screenshot可写--sc。三条常用指令直接复制umi-ocr --screenshot --clip umi-ocr --path D:/扫描件.png --output result.txt umi-ocr --qrcode_create 你好 D:/qrcode.png 256第一条截屏识别、结果直接进剪贴板第三条生成一张 256 像素的二维码。配合快捷键工具能实现按一个键自动截指定区域并识别。完整参数见 docs/README_CLI.md。HTTP 接口启动后本地服务提供 OCR、文档识别、二维码三类接口几十行代码就能封装成局域网小工具跑通上传图片 → 返回 JSON 结果详见 docs/http/api_doc.md。插件库与路线图项目有独立插件库可切换并扩展更多识别后端公式识别也在路线图上。版本演进要点完整版见 CHANGE_LOG.mdv2.1.0加入文档识别v2.1.2支持单层纯文本 PDF、任务暂停v2.1.3登陆 Linux 并支持 Docker 部署v2.1.4限制 PaddleOCR 内存占用v2.1.5修复 PDF 旋转页面文本错位、优化超大文件夹加载Umi-OCR 免费、开源、完全离线把屏幕上的文字还到你手里。从随手摘抄一段屏幕文字到批量归档几百张图、把扫描版 PDF 转成可搜索文档三条主线覆盖了绝大多数场景。下次再遇到复制不了的字打开它不用上传直接拿。【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片PDF文档识别排除水印/页眉页脚扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表