
Umi-OCR 离线OCR完整教程截图识别、批量识别、PDF文档识别一网打尽【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片PDF文档识别排除水印/页眉页脚扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR同事发来一份扫描版PDF合同你想引用其中一段条款全选、复制屏幕上却只有一行无法从此PDF复制文字。转投在线识别网站要么文件超大小限制要么一天只有几次免费额度——更要命的是这些敏感文件得先上传到别人的服务器。这个场景正是Umi-OCR存在的理由一款开源、免费、完全离线的OCR软件把识别引擎整个搬进你的电脑图片和文档自始至终不离开硬盘。为什么是它一次安装永久免费对比一下就清楚了。在线OCR服务有次数和大小限制、要联网、文件过境第三方服务器系统自带工具功能单一往往只支持截图。Umi-OCR把这些通病一次解决解压即用、不限次数、本地计算支持截屏、批量、PDF文档识别三种主流方式还内置多国语言库。一句话定位给Windows和Linux用户的一把本地文字剪刀剪哪里、剪多少全凭你自己。三分钟跑起来解压即用的最短路径Umi-OCR是绿色软件不需要安装启动只需三步下载从项目发布页获取.7z压缩包或选.7z.exe自解压包电脑没装压缩软件时用这个双击即解压。解压解压到任意目录如D:/Tools/Umi-OCR。注意路径别带中文和空格能省掉很多莫名奇妙的兼容问题。启动Windows双击Umi-OCR.exeLinux运行umi-ocr.sh。第一次启动会自动读取系统语言切换界面想手动改去全局设置即可。主界面由截图OCR、批量OCR、文档识别、二维码、全局设置等标签页组成像浏览器标签栏一样想用哪个点哪个还能锁住常用标签防止误关。核心能力逐个点亮截图OCR屏幕上看到的文字随抓随用最高频的场景看到一段文字想立刻复制。打开截图OCR标签页按快捷键唤起截图框划出目标区域识别结果立刻出现在右侧记录栏。不用先截图在聊天窗口复制一张图片回到Umi-OCR直接粘贴就能识别。结果可二次编辑记录栏里的文字能直接改错还能划选多条一起复制。竖排文字也能处理排版解析自动识别横排和竖排从右到左文本。很多人不知道的小技巧截图识别配合单栏-保留缩进排版方案把代码截图扔进去输出能基本保持缩进结构识别完直接就是可用的代码文本。批量OCR几百张图片一口气处理遇到几十上百张截图、扫描件、相册照片一张张截屏就太亏了。切到批量OCR标签页把图片拖进窗口支持jpg、png、webp、bmp、tif、tiff等常见格式一次拖几百张也没有数量上限。点开始任务右侧逐张显示耗时、置信度和结果跑完可导出txt、jsonl、md、csv四种格式csv可直接用Excel打开。深夜挂机场景还支持任务完成后自动关机或待机。忽略区域是批量识别的高频利器在右侧设置进入忽略区域编辑器按住右键在图片上绘制多个矩形框把水印、LOGO、页眉页脚可能出现的位置全部框住识别时这些区域内的文字会被自动排除。给论文批量转换时用一次把统一的页眉页脚框掉输出会干净很多。必须记住的机制只有完全处于矩形框内部的整个文本块才会被忽略不是单个字符。所以画框宁可大一点把水印可能出现的位置都包住否则漏框一次结果里就混进一行杂音。文档识别扫描版PDF也能变成可搜索文本文档识别是压轴功能支持pdf、xps、epub、mobi、fb2、cbz六种格式底层逻辑三步解析 → 识别 → 重组。PDF先被解析引擎依赖PyMuPDF拆开区分本来就有的文本层和需要OCR的扫描图片层扫描层交给本地OCR引擎逐页识别最后按阅读顺序重新拼装输出。两个亮点值得展开双层可搜索PDF对扫描版PDF做OCR后输出底层是原图、上层是透明文字的双层PDF。外观跟原扫描件一模一样但文字可以搜索、复制、划线。历史合同归档、论文数字化都能直接顶上。灵活的提取模式默认优先提取PDF自带文本层速度快、零误差遇到纯扫描页才自动切到OCR。也可以主动选整页强制OCR或只提取原文本。v2.1.2起还支持输出单层纯文本PDF想要体积小、好编辑的文件时选它。排版与多语言给结果排座位给界面换面孔OCR引擎吐出的文字是散装的谁先谁后由排版解析决定。Umi-OCR内置多套方案选对方案输出才符合阅读习惯方案适用场景多栏-按自然段换行两栏/三栏论文书籍自动断行最常用多栏-总是换行每句独立成行适合按行处理多栏-无换行整段合并成一行单栏-保留缩进代码截图专用保留缩进与空格不做处理引擎原始输出不确定选哪个就选多栏-按自然段换行能覆盖大多数场景特殊排版再逐个切换对比。界面语言方面全局设置里可切换中、英、日、俄、葡等多种语言由社区译者维护。注意界面语言和识别语言库是两回事界面语言管按钮菜单识别语言库管引擎认哪种文字。识别语言在各标签页的文字识别设置里单独选择下载——界面用中文、日常识别日文书籍完全可以搭配使用。别踩这些坑8个高频问题的标准答案忽略区域画了却没效果检查框是否够大——只有整个文本块完全在框内才会被忽略再确认保存了配置。长图识别结果缺字调高限制图像边长别盲目放大原图过度放大增加噪声反而降准确率。截图时界面闪烁、错位去全局设置→界面和外观→渲染器切换渲染方案或关闭硬件加速。命令行没反应Umi-OCR靠本地HTTP服务做进程间通信确认全局设置里HTTP服务已开启默认开启只监听本地回环不经过物理网卡数据不外泄。批量任务想中途休息v2.1.2起支持暂停任务只要软件不退出待机/休眠后还能继续跑。代码截图排版全乱切到单栏-保留缩进。多栏论文输出顺序串行切到多栏-按自然段换行。文件夹里几万文件加载很卡v2.1.5优化了异步加载机制等预览界面加载进度完成再操作。进阶玩法命令行、HTTP接口与插件生态图形界面之外Umi-OCR还提供两条程序化通道方便接入自己的工作流。命令行模式直接复用主程序几个常用姿势# 截屏识别结果直接进剪贴板 umi-ocr --screenshot --clip # 识别指定图片输出到文件 umi-ocr --path D:/扫描件.png --output result.txt # 识别整个文件夹含子目录 umi-ocr --path D:/scans -- all_result.txt # 生成二维码 umi-ocr --qrcode_create 你好Umi-OCR D:/qrcode.png 256完整参数和简写规则见项目内docs/README_CLI.md命令行手册。HTTP接口方面程序启动后本地服务提供OCR、文档识别、二维码等接口文档在docs/http/api_doc.md几十行代码就能封装成上传图片→返回JSON识别结果的小工具。引擎方面默认内置Rapid-OCR兼容性好和PaddleOCR速度快全局设置可随时切换还有独立插件库可扩展更多引擎v2.1.3起支持Linux和Docker部署服务器玩家也能用。版本更新记得跟进CHANGE_LOG.md记录了每个版本演进——v2.1.0加入文档识别、v2.1.2支持单层纯文本PDF与任务暂停、v2.1.5修复了PDF页面旋转导致的文本错位。手头有旋转过方向的扫描件务必用最新版。小结Umi-OCR是一款免费、开源、离线运行的OCR工具装好就能用截图、批量、文档识别三大功能覆盖了从日常摘抄到批量归档的绝大多数场景遇到问题别慌忽略区域、排版方案、渲染器这几个旋钮能解决大部分麻烦。下次再收到扫描版PDF或面对一堆带水印的图片时打开Umi-OCR试试——你会发现自己已经不再需要在线工具和手动抄录了。【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片PDF文档识别排除水印/页眉页脚扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考