ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

离线识别整屏代码、批量处理 PDF:Umi-OCR 离线文字识别上手手册

离线识别整屏代码、批量处理 PDF:Umi-OCR 离线文字识别上手手册 离线识别整屏代码、批量处理 PDFUmi-OCR 离线文字识别上手手册【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片PDF文档识别排除水印/页眉页脚扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR如果你经常需要从屏幕截图里抠代码、从扫描件里提文字又不想把图片上传到任何在线服务Umi-OCR 值得装一个。它是一款免费、开源、完全离线的 OCR 工具所有识别都在本机完成支持截图识别、批量图片 OCR、PDF 文档识别和二维码扫描。读完本文你能独立完成快捷键截屏出文字、一键处理几百张扫描图、用命令行和 HTTP 接口把它接进自己的自动化脚本。五分钟准备工作解压、启动、跑通第一次识别环境要求与最短安装路径Umi-OCR 不需要安装解压即用系统Windows 7 x64 及以上或 Linux x64网络完全不需要识别全程离线获取方式从官方渠道下载.7z压缩包或.7z.exe自解压包Linux 下源码可git clone https://gitcode.com/GitHub_Trending/um/Umi-OCR后按 构建文档 部署首次运行的 4 步自检解压后双击Umi-OCR.exeLinux 为umi-ocr.sh界面语言会自动跟随系统打开截图OCR标签页按一下截图快捷键唤起全屏框选框选任意一段屏幕文字确认右侧识别记录栏出现文本点复制按钮粘贴到记事本第一次识别就跑通了如果界面闪烁或 UI 错位去全局设置 → 界面和外观 → 渲染器换成其他渲染方案或关闭硬件加速。所有设置都保存在UmiOCR-data/.settings这个 ini 文件里可以直接手改后用umi-ocr --reload重新加载。单图快速识别怎么做截屏、粘贴与排版解析单图识别有三个入口截图快捷键、在别处复制图片后粘贴、或拖入本地图片。识别完成后右侧记录栏支持划选多段记录合并复制左侧预览栏可以直接用鼠标框选部分文字。排版解析方案怎么选识别出的原始结果是一堆零散文字块排版解析负责把它们拼成可读文本。这是 Umi-OCR 里最容易被忽略、但对结果影响最大的开关。一句话理解OCR 引擎只负责找到每个词排版解析负责决定哪里换行。8 种预设方案的实际取舍方案参数值适用情况多栏-按自然段换行multi_para默认大部分文档场景自动识别多栏布局多栏-总是换行multi_line每句都要独立成行的清单类内容单栏-按自然段换行single_para明确是单栏的普通文本单栏-保留缩进single_code代码截图保留行首缩进和行中空格不做处理none引擎原始输出自己后处理截图代码片段时把这里切到single_codeif、for的缩进层级会原样保留粘贴进编辑器不用二次对齐。横排、竖排从右到左排版都能自动处理前提是 OCR 引擎本身支持该语言的竖排。批量图片 OCR 怎么做一次导入几百张切到批量OCR标签页把图片或文件夹拖进去即可官方明确没有数量上限几百张长图可以一次性排队。输入格式jpg, jpe, jpeg, jfif, png, webp, bmp, tif, tiff输出格式txt、jsonl、md、csv(Excel)每张图对应一个同名结果文件附带功能任务完成后可自动关机/待机适合下班前丢一批任务走人忽略区域框掉水印、页眉页脚批量扫描的扫描件常带固定位置的水印或 LOGO识别结果会被这些文字污染。忽略区域就是画禁区在批量识别页右栏设置里进入忽略区域编辑器按住右键在预览图上拖动画出矩形框可画多个框要画大把水印所有可能出现的位置都包进去重新跑任务确认结果里水印文字消失注意一条规则只有完整落在框内的文本块才会被丢掉字符级不生效。一个块只要有一部分伸到框外就会整块保留。所以宁可框大 20 像素也别贴着水印画。PDF 文档 OCR 怎么做输出双层可搜索 PDF文档识别标签页处理pdf, xps, epub, mobi, fb2, cbz六类文件。对扫描件它先逐页 OCR 再合成输出对已有文本层的 PDF直接抽取原有文本速度更快。两个实用点双层可搜索PDF输出的 PDF 保留原始页面外观底下垫一层不可见的识别文本CtrlF 能直接搜索、能复制文字档案归档场景首选忽略区域同样可用把固定位置的页眉、页脚、页码框掉避免每页多出一行垃圾文本用代码调用 Umi-OCR 怎么做命令行与 HTTP 接口命令行入口就是主程序本身。前提是 HTTP 服务处于开启状态默认开启命令通过本机回环传给后台进程不经过物理网卡# 截图识别结果写入文件箭头等价于 --output umi-ocr --screenshot -- result.txt # 批量识别整个文件夹含子目录 umi-ocr --path D:/scan -- all.txt # 识别二维码 umi-ocr --qrcode_read D:/qr.png完整参数查 命令行手册指令支持简写--screenshot可缩成--sc。一个已知限制系统管道重定向符可能失效程序间调用请改用 HTTP 转发命令行接口。HTTP 接口默认端口1224识别接口是POST /api/ocr请求体只放两样东西base64 图片串和可选的参数字典import requests, base64 with open(scan.png, rb) as f: b64 base64.b64encode(f.read()).decode() res requests.post(http://127.0.0.1:1224/api/ocr, json{ base64: b64, options: { tbpu.parser: multi_para, # 排版解析方案 data.format: text, # 直接返回纯文本 }, }).json() print(res[code], res[data]) # code100 成功, 101 图中无文本不确定能传哪些参数先GET /api/ocr/get_options它返回全部参数的定义、默认值和可选值可以直接照着生成前端界面。接口细节见 HTTP 接口手册 与 图片OCR接口。引擎与配置选型PaddleOCR 和 RapidOCR 用哪个发行版内置 OCR 引擎Scoop 安装时分两个包umi-ocr自带 RapidOCR兼容性好umi-ocr-paddle自带 PaddleOCR速度稍快两个别同时装后续可装插件切换。选型看这张表场景推荐引擎语言模型ocr.languageocr.limit_side_len说明中文文档批量扫描PaddleOCRmodels/config_chinese.txt默认960默认边长超限的图会压缩960 兼顾速度和精度超大长图、高清图PaddleOCR同上2880或4320调高边长限制换取大图精度批量页文字识别里可调英文/代码为主PaddleOCRmodels/config_en.txt960切英文模型减少误识别日文、韩文、俄文PaddleOCRconfig_japan/config_korean/config_cyrillic.txt960模型文件在引擎的models/目录低端机器、求兼容RapidOCR调 get_options 接口确认同上不同引擎参数名可能不同以查询接口返回为准两条注意ocr.language、ocr.cls纠正文本方向、ocr.limit_side_len这三个参数只对 PaddleOCR 引擎生效其他引擎请以参数查询接口返回为准ocr.cls默认false开启后才能识别倾斜、倒置文字代价是速度下降扫描件没歪就不用开端到端演练跑通一个带水印的批量识别任务拿一个真实任务走完全程50 张带右上角固定水印的扫描单据输出 Excel 可用的 csv。打开批量OCR页拖入文件夹确认左侧列表出现 50 个任务右侧设置里输出格式选csv(Excel)保存路径选一个空目录排版解析保持默认的multi_para若是英文单据语言切models/config_en.txt进入忽略区域编辑器按住右键框住右上角水印区框比水印实际位置四周各放大 15 像素左右点击开始任务观察进度条跑完验证结果抽查 3 张 csv 内容水印文字应完全消失正文首行不被误删若正文丢了说明忽略框画大了打开一张data.format为 dict 的接口返回检查score字段置信度低于 0.8 的文本块重点人工复核文件数对账输入 50 张输出目录应有 50 个结果文件第二条可选演练同一批图片改用umi-ocr --path 文件夹 -- out.txt走命令行对比重跑——结果一致说明你的界面配置已被UmiOCR-data/.settings正确保存脚本化调用可以放手做了。常见问题 FAQ问识别精度不理想先调什么答按顺序试① 把ocr.limit_side_len从 960 调到 2880② 语言模型切到匹配语种③ 扫描件倾斜时开ocr.cls true。三步做完还差多半是原图分辨率不够先做图像预处理。问批量任务跑到一半报 ECONNREFUSED答长时间大批量连续调用时小概率出现重发一次请求即可工作线程没崩就不会持续报错。接口对并发支持较差脚本里请串行调用。问命令行重定向收不到输出答运行环境限制导致管道重定向可能失效程序间调用改用 HTTP 转发命令行接口或直接用--output落盘再读文件。问忽略区域为什么没删干净水印答只有整块完整落在框内的文本块才会被丢弃。检查框是否把水印完全包住以及水印是否和正文粘连成了同一个文本块——粘连时只能靠调图或裁剪解决。问关软件时卡住退不出答若有 HTTP 客户端没断开连接UI 线程结束后子线程会滞留。等连接断开或任务管理器结束进程服务端脚本调用记得用完就关连接。收尾行动清单读完立刻可以做的三件事今天解压发行版跑通第一次截图识别把截图页的排版解析切到single_code试一张代码截图确认缩进保留本周找一个 20 张以上的图片文件夹走一遍批量 OCR练一次忽略区域输出 csv 并抽查 3 份结果本周写 10 行以内的脚本调POST /api/ocr把一张图片识别结果打进终端打通自动化入口想再深入按 README 的目录索引找二维码、插件和构建章节更新记录看 CHANGE_LOG。【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片PDF文档识别排除水印/页眉页脚扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表