ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

Umi-OCR 使用指南:离线 OCR 如何识别截图、批量图片与扫描版 PDF(附 7 个实用技巧)

Umi-OCR 使用指南:离线 OCR 如何识别截图、批量图片与扫描版 PDF(附 7 个实用技巧) Umi-OCR 使用指南离线 OCR 如何识别截图、批量图片与扫描版 PDF附 7 个实用技巧【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片PDF文档识别排除水印/页眉页脚扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR手上有份扫描版合同想搜个条款相册里躺着两百张截图想一次性把文字抠出来。但这些东西你不敢往任何在线识别网站上传——而 Umi-OCR 正是为此而生的本地 OCR 软件识别引擎完整装在你的硬盘里图片自始至终不经过网络文字随取随用免费且开源。可以把 Umi-OCR 理解成一间建在自己家里的文字提取室图片是客人进门、识别、出结果全程不出这道门。不注册、不限额、断网照用。下面按你手里拿的是什么来走先花三分钟装好它然后分别处理屏幕上的一小块字、一整份扫描文档、一摞图片最后讲怎么把输出打磨干净、怎么嵌入工作流以及出问题时怎么查。装好它绿色免安装三步启动Umi-OCR 不需要安装过程全部动作都在解压这一步完成下载从项目发布页拿.7z压缩包装了压缩软件就用它或.7z.exe自解压包没装压缩软件双击它就能解开。解压放到任意目录比如D:\Tools\Umi-OCR。路径里避免中文和空格能少很多莫名其妙的小毛病。启动Windows 双击Umi-OCR.exeLinux 运行umi-ocr.sh。两个提前量杀毒白名单软件内置 OCR 引擎和运行库部分杀软会误报甚至拦文件。启动前把整个目录加入信任列表能省掉后面为什么打不开/闪退的排查。界面语言首次启动会按系统语言自动设置之后可在全局设置 → 语言/Language手动改支持简中、繁中、英文、日文、俄语、葡萄牙语等。主窗口由标签页组成——截图OCR、批量OCR、文档识别、二维码、全局设置像浏览器标签栏一样点哪个用哪个还能锁住常用标签防误关。场景一屏幕上的一小块字想立刻拿走怎么做打开截图OCR标签页按快捷键唤起截图框划出目标区域文字马上出现在右侧记录栏。关键小技巧不截图也能识别在聊天窗口、文档里复制一张图片回到 Umi-OCR 直接粘贴效果一样。结果可以就地改记录栏里的文字能直接编辑纠错划选多条记录可一起复制只复制选中项也行省去跳去编辑器的环节。只复制一部分在左侧预览图上划选区域右键即可复制文字不用整段带走。常见变体竖排文字从右到左也支持排版解析会自动处理横排/竖排前提是所用识别语言库本身认这种文字代码截图想保住缩进把排版方案切到单栏-保留缩进即可效果见下文排版方案。场景二一整份扫描文档想变成能搜能改这是扫描版 PDF OCR最典型的需求整本扫描件里全是图片搜索、复制统统失效。文档识别标签页支持pdf、xps、epub、mobi、fb2、cbz六种格式底层流程是三步解析PDF 被拆开区分本来就有的文本层和需要 OCR 的扫描图片层识别扫描页交给本地 OCR 引擎逐页处理重组按阅读顺序拼回输出你选定的格式。两个最值得展开的机制双层可搜索 PDFOCR 完成后输出底层原图 上层透明文字的 PDF——外观和扫描件分毫不差但每个字都能搜索、复制、划线。历史合同归档、旧书数字化直接用它。提取模式默认优先提取 PDF 自带文本层快且零识别误差纯扫描页自动切到 OCR你也可以选整页强制 OCR或只提取原文本。想要体积小、好编辑的文件新版还支持输出单层纯文本 PDF。文档识别同样支持按页码范围设置忽略区域专治页眉页脚混入并可在任务完成后自动关机/待机。场景三一摞图片想一次性清完切到批量OCR标签页把图片直接拖进窗口支持jpg、png、webp、bmp、tif、tiff等格式几百张一次拖入没有数量上限。点开始任务右侧逐张显示耗时、置信度和识别结果。任务完成后可按需保存为四种格式输出格式适用场景txt纯文本存档最通用jsonl程序化处理每行一条 JSONmd需要保留标题层级时csvExcel 可直接打开做表格统计、逐行核对挂机场景的两个贴心设计任务完成后自动关机/待机——睡前扔进去几百张图醒来收结果批量任务还支持暂停只要不退出软件待机/休眠之后可以接着跑。把输出打磨干净忽略区域、排版方案、引擎与语言识别完只是拿到字调优决定拿到的字干不干净。忽略区域去水印图片角落的水印、LOGO、页眉页脚每次都会混进结果。在批量识别页右侧设置进入忽略区域编辑器按住右键在图片上绘制多个矩形框框内文字会被自动排除——这是批量处理带水印图片、论文扫描件时最省人工的一步。必须记住一条规则只有整个文本块完全落在框内才会被忽略不是按单字。所以框宁可画大一点把水印可能出现的所有位置都包住框小了一行杂音照样漏进来。文档识别里的忽略区域同理还多了一个页码范围选项。排版方案给文字排座位OCR 引擎吐出的文字顺序常常是散装的排版解析负责重新排序。预设方案对照表方案何时选它多栏-按自然段换行两栏/三栏的论文、书籍自动断段默认首选多栏-总是换行每句独立成行方便按行处理多栏-无换行强制整段并成一行单栏-按自然段换行 / 总是换行 / 无换行单栏文档的三种粒度单栏-保留缩进代码截图专用保住行首缩进与行中空格不做处理引擎原始输出不做整理拿不准就选多栏-按自然段换行它覆盖面最广所有方案都自动处理横排和竖排从右到左文字。引擎选择以及两个语言的区别OCR 引擎软件内置Rapid-OCR兼容性好和PaddleOCR速度更快两套全局设置里随时切换。识别不准、报错时换引擎往往比抠其他参数见效快。界面语言 ≠ 识别语言前者管按钮菜单长什么样全局设置 → 语言/Language后者管引擎认哪种文字在各标签页的文字识别设置里单独选择或下载语言库。界面用中文、日常识别日文书籍完全两不误。性能三件事大图/长图识别不全去文字识别设置调高限制图像边长别盲目放大原图——过度放大反而引入噪声、拉低准确率。内存偏高PaddleOCR 插件默认内存占用不超过系统总内存的一半想再压可在插件配置里调低线程数。截屏闪烁、界面错位显卡渲染兼容问题全局设置 → 界面和外观 → 渲染器换渲染方案或关闭硬件加速即可。进阶把 Umi-OCR 嵌进工作流图形界面之外还有两条程序化通道。命令行入口就是主程序本身指令支持简写--screenshot可写成--sc常用两条# 截屏识别结果直接进剪贴板 umi-ocr --screenshot --clip # 识别指定图片结果写入文件 umi-ocr --path D:/扫描件.png --output result.txt还支持--path传入整个文件夹含子目录、指定显示器与矩形区域自动截图免鼠标划选、命令行生成指定尺寸的二维码等。完整参数见 docs/README_CLI.md。HTTP 接口软件启动后本地 HTTP 服务提供图片 OCR、文档识别、二维码识别/生成等接口默认开启仅监听本地环回数据不出机器。用几十行代码就能把它封装成局域网小工具接入自动化流程。接口文档见 docs/http/README.md 与 docs/http/api_doc.md。插件生态与版本演进除内置两套引擎外项目维护独立的插件库可导入更多 OCR 引擎随时切换公式识别等能力已在开发路线图上。版本脉络值得看一眼——文档识别、任务暂停、单层纯文本 PDF、Linux 与 Docker 部署、PaddleOCR 内存限制、超大文件夹加载优化都在 CHANGE_LOG.md 里有记录。如果手里有旋转过方向的扫描件务必用最新版页面旋转导致的文本错位已修复。出问题了怎么查7 个高频故障的对策命令行输入没反应命令行依赖本地 HTTP 服务做进程间通信确认全局设置里 HTTP 服务已开启默认开启另外命令行入口要用主程序Umi-OCR.exe备用启动器可能不支持。长图识别缺胳膊少腿调高限制图像边长而不是放大原图。截图时界面闪烁、错位换渲染器或关闭硬件加速全局设置 → 界面和外观 → 渲染器。忽略区域画了却没用记住整块才算——确认文本块完全在框内并且配置已保存。某个字认不准、偶尔报错先切引擎试试Rapid-OCR 与 PaddleOCR 互为备选。内存占用吃紧确认是 PaddleOCR 插件在其配置里调低线程数。界面突然变外语全局设置 → 语言/Language 切回目标语言即可识别语言库不受影响。写在最后想象这样一个画面深夜你把一整箱翻拍的发票和旧合同扫描件拖进批量标签页框掉四角的水印设好完成后关机然后去睡觉。第二天醒来一摞 txt 和双层可搜索 PDF 整整齐齐躺在硬盘里——没有一张图片经过任何一台外网服务器没有一次注册没有一分钱费用。下次再遇到复制不了的字打开 Umi-OCR让它在你自己的地盘里把活干完。【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片PDF文档识别排除水印/页眉页脚扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表