ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

Umi-OCR 离线 OCR 实战指南:屏幕、批量图片、扫描件 PDF 的取字方法

Umi-OCR 离线 OCR 实战指南:屏幕、批量图片、扫描件 PDF 的取字方法 Umi-OCR 离线 OCR 实战指南屏幕、批量图片、扫描件 PDF 的取字方法【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片PDF文档识别排除水印/页眉页脚扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR图片里的文字选不中、复制不了一个字符一个字符敲进文档是折磨。Umi-OCR 是一款免费、完全离线的 OCR 工具识别引擎整套装在你的电脑上截个屏就能拿到文字图片不离开硬盘不注册、不上传。Windows 与 Linux x64 都支持。从解压到认出第一段字Umi-OCR 是解压即用的软件三步跑起来从发布页拿.7z压缩包电脑没装压缩软件就拿.7z.exe自解压包双击自动解开。放到任意目录例如D:\Tools\Umi-OCR。Windows 双击Umi-OCR.exeLinux 运行umi-ocr.sh。首次启动界面语言按你的系统自动切换想改随时去全局设置 → 语言/Language。主窗口由标签页组成截图OCR、批量OCR、文档识别、二维码、全局设置点哪个用哪个。打开截图OCR标签用快捷键唤起截图框圈住几个字识别出的文字立刻出现在右侧记录栏——这就是你的第一份产出。提醒如果你打算用命令行或 HTTP 接口入口必须是主程序 Umi-OCR.exe备用启动器 RUN_GUI.bat 不保证支持HTTP 服务默认开启且只监听本地环回一般不用动。把屏幕上的字抓下来 最高频的场景。打开截图OCR标签 → 快捷键唤起截图框 → 框住目标文字 → 结果落到右侧记录面板。两个容易漏掉的入口在别处复制一张图片比如聊天窗口的图回到 Umi-OCR 直接粘贴照样识别。记录面板里的文字可直接改错还能划选多条记录一起复制CtrlA选中全部整理完直接拿走不用跳去别的编辑器。引擎吐出来的其实是散装纸片文本块你读到的顺序由排版解析后处理决定像编辑把纸片归拢好再交给你。两栏、三栏的论文书籍选多栏-按自然段换行覆盖面最广代码截图切单栏-保留缩进行首缩进和行中空格基本保住。竖排文字从右到左各方案都会自动处理前提是识别语言库本身支持。提醒命令行里 截图、粘贴、路径 三类任务的参数都取截图OCR标签页的设置如果你不希望命令行任务弹出主窗口先在那个标签页关掉对应选项。几百张图一次归档切到批量OCR标签把图片直接拖进窗口→ 点开始任务→ 右栏逐张给出耗时、置信度和结果。收 jpg、jpeg、png、webp、bmp、tif、tiff数量没有上限几百张一次进队。跑完可导出txt、jsonl、md、csv四种格式csv 用 Excel 直接打开跑整夜的任务可设任务完成后自动关机/待机v2.1.2 起还支持暂停任务不退出软件待机后接着跑。高频痛点是图片角落的水印、LOGO 每次都混进结果。忽略区域就是为此做的从批量页右栏设置进入忽略区域编辑器按住右键在图片上画多个矩形框像贴条一样把不想被看到的位置盖住这些区域的文字识别时自动排除。避坑只有整个文本块完全落在框内才会被忽略不是按单个字符。框画小一圈跨着框边的文字照样混进结果——宁可大一点把水印可能出现的位置全包进去。让扫描件 PDF 能搜到 文档识别标签收pdf、xps、epub、mobi、fb2、cbz典型输入就是扫描版 PDF。底层走三步先把文档拆成现成文本层和需要识别的图片层底层依赖 PyMuPDF扫描页交给本地引擎逐页识别最后按阅读顺序重组输出你指定的格式。两种产物按需选双层可搜索 PDF底层是原图上层是透明文字外观和扫描件一模一样文字却能搜索、复制、划线适合归档旧合同、数字化论文。单层纯文本 PDFv2.1.2 起支持不带图片体积小、好编辑。提取模式默认优先提取 PDF 自带文本层快、零识别误差纯扫描页才切 OCR还能按页码范围设忽略区域排除页眉页脚并设置任务完成后自动关机/休眠。避坑手里有旋转过方向的扫描件请升到 v2.1.5 以上——修复过提取 PDF 自带文本时未考虑页面旋转导致的错位问题。顺手扫二维码和生成二维码二维码标签干两件事扫码和生成。截图、粘贴或拖入图片读出其中的二维码、条形码支持一图多码和 QRCode、Code128、EAN13 等 19 种协议输入文本即可生成二维码图片大小和纠错等级可选。出状况时症状 → 开关速查症状可能原因往哪拧长图、大图识别不全默认限制图像边长为平衡速度内存做了压缩标签页设置 →文字识别→限制图像边长调高代码截图缩进全丢排版解析方案不匹配文本后处理 →单栏-保留缩进水印文字还在混进结果忽略区域框没包全忽略区域编辑器里把矩形画大重画截图时屏幕闪烁、UI 错位显卡渲染兼容问题全局设置 →界面和外观→渲染器换方案或关硬件加速内存占用偏高引擎默认线程配置v2.1.4 起 PaddleOCR 已限在系统内存一半以内插件配置里再调低线程数几万个文件的文件夹加载卡预览尚未加载完v2.1.5 起异步加载等进度走完再操作问答速查识别与结果识别日文/英文不准怎么办识别语言库和界面语言是两回事在各标签页文字识别设置里单独选或下载对应语言库。识别效果不理想先在全局设置切换 OCR 插件试试RapidOCR 兼容性好PaddleOCR 速度稍快往往比调别的参数见效快。界面与语言界面语言怎么换全局设置 → 语言/Language支持简中、繁中、英语、日语、俄语、葡萄牙语等首启跟随系统。怎么防止误关常用标签标签栏右上角点击锁定标签页。任务与调用批量任务能中途暂停吗v2.1.2 起支持暂停任务只要不退出软件待机/休眠后可恢复。命令行没反应确认全局设置里 HTTP 服务已开启默认开启且入口用的是 Umi-OCR.exe 而不是备用启动器。进阶把 Umi-OCR 挂到快捷键上 ⚡命令行入口就是主程序指令支持简写--screenshot可写--sc通信走本地 HTTP 服务默认开启、只监听本地环回。三条可直接复制的例子umi-ocr --screenshot --clip umi-ocr --path D:/扫描件.png --output result.txt umi-ocr --qrcode_create 你好 D:/qrcode.png 256第一条截屏识别并把结果直接进剪贴板第三条生成一张 256 像素的二维码。想写脚本的话本地服务还开放了图片 OCR、文档识别、二维码三类接口见 HTTP接口手册 与 文档识别接口命令行全参数在 命令行手册 里。免费、开源、完全离线Umi-OCR 用截图、批量、文档识别三条主线覆盖从随手摘抄到整夜归档的绝大多数场景。现在就可以下载解压下次再遇到复制不了的字先截个图不用上传。【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片PDF文档识别排除水印/页眉页脚扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表