ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

Umi-OCR 完整指南:免费离线 OCR,从截图取字到批量识别与自动化集成

Umi-OCR 完整指南:免费离线 OCR,从截图取字到批量识别与自动化集成 Umi-OCR 完整指南免费离线 OCR从截图取字到批量识别与自动化集成【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片PDF文档识别排除水印/页眉页脚扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCRUmi-OCR 是一款免费、开源、完全离线运行的 OCR 文字识别软件支持截图 OCR、批量图片识别、PDF 文档识别、二维码识别与生成适用于 Windows 7 x64 与 Linux x64。如果你受够了上传扫描件到云端等结果或者只是想在本地随手截个图提取文字它可以解压即用、断网工作适合普通办公用户、文档处理重度用户以及想把文字识别能力接进自己脚本里的开发者。为什么选 Umi-OCR完全免费开源全部代码可查无会员、无识别次数限制。离线运行识别引擎内置在本地数据不出机器隐私场景友好。解压即用不需要安装、不依赖网络Win7 老机器也能跑。多语言内置识别库覆盖中文繁简、英语、日语、韩语、俄语等界面也支持多国语言。可脚本化提供命令行与 HTTP 接口两种调用方式方便接入自动化流程。快速上手三步跑起来Windows下载解压双击启动从项目的发布渠道下载.7z压缩包或.7z.exe自解压包解压到任意目录无需安装双击Umi-OCR.exe启动首次打开会自动跟随系统语言。如果你习惯用包管理器Scoop 也可以scoop bucket add extras scoop install extras/umi-ocr # 自带 RapidOCR 引擎 # 或 scoop install extras/umi-ocr-paddle # 自带 PaddleOCR 引擎两种安装包不要同时装快捷方式会互相覆盖引擎可以在装完后通过插件随时切换。Linux运行脚本直接跑下载 Linux 版发布包并解压后运行启动脚本即可./umi-ocr.sh若系统环境较老Debian 11、Ubuntu 20 等按官方运行库仓库的说明部署依赖即可新版已把 glibc 依赖降到 2.31 以兼容更多发行版也有 Docker 部署方式可供服务器场景使用。源码方式供开发者需要构建或二次开发时clone 仓库后按运行库仓库的指引部署环境git clone https://gitcode.com/GitHub_Trending/um/Umi-OCR主仓库包含UmiOCR-data/main.py入口与py_src/Python 源码构建细节请查阅运行库仓库文档。核心场景实战随手一截从屏幕直接取文字打开截图OCR标签页按快捷键划选屏幕区域识别结果立刻出现在右侧记录栏。左侧图片预览支持鼠标划选复制识别记录可以编辑、跨条全选后一次性复制。在别的程序里CtrlC了图片直接粘贴进 Umi-OCR 也能识别。识别完还不是终点文本后处理决定文字好不好用多栏-按自然段换行适合大多数文章场景自动分辨多栏排版单栏-保留缩进解析代码截图时选它行首缩进原样保留上图中代码的缩进就是靠它保住的横排、竖排从右到左排版都能处理竖排还需要引擎本身支持。批量处理一个文件夹的图片一次认完需要处理几十上百张图时切到批量OCR页把图片或整个文件夹拖进来点开始任务。支持jpg / jpe / jpeg / jfif / png / webp / bmp / tif / tiff等格式没有数量上限结果可存为TXT、JSONL、Markdown、CSVExcel四种格式任务完成后还能自动关机或待机夜里挂机跑正合适。这个页面藏着一个实用功能——忽略区域点右侧设置进入编辑器按住右键画几个矩形框尽量画大把水印可能出现的位置全包进去框内的文本块会在任务中被跳过。扫描件的水印、页眉页脚固定出现时画一次就能受用所有图片。纸质变可搜索扫描件 PDF 转双层 PDF文档识别页支持pdf、xps、epub、mobi、fb2、cbz等格式逻辑分两种扫描件 PDF做 OCR生成双层可搜索PDF——外观不变但文字可以被 CtrlF 搜索和选中电子文档EPUB/MOBI 等直接提取原有文本省去逐页识别。同样支持忽略区域对付每页固定的页眉页脚和完成后自动关机。批量整理档案、合同、发票扫描件时这是最省时间的路径。读码与造码二维码、条形码一站搞定二维码页既能读也能造扫码截图、粘贴或拖入图片即可识别支持一张图里多个码覆盖 QRCode、DataMatrix、PDF417、EAN13、Code128、MaxiCode 等 19 种协议商品条形码也能读生成输入文本调整协议与纠错等级等参数实时预览并保存成图片。快递单、设备铭牌上的码以及需要发出去的内部二维码在这一页就能闭环处理。进阶集成命令行与 HTTP 接口普通用法之外Umi-OCR 有两种对外接入方式方便做自动化。命令行CLI调用入口就是主程序Umi-OCR.exe命令行手册见 docs/README_CLI.md。前置条件只有一个全局设置页里保持 HTTP 服务开启默认就是开的主机选仅本地即可——指令经本地环回传给后台进程不走外部网络。最常用就这几条umi-ocr --screenshot # 鼠标划选截屏识别 umi-ocr --clipboard # 识别剪贴板里的图片 umi-ocr --path D:/images # 批量识别文件夹含子目录 umi-ocr --screenshot --clip # 识别后自动复制到剪贴板 umi-ocr --qrcode_read D:/code.png umi-ocr --qrcode_create 文本内容 D:/output.png 128结果输出支持--clip剪贴板、--output 文件覆盖写入、--output_append 文件追加写入。注意由于运行环境限制shell 的、|重定向可能失效需要程序化取结果时请改用下面的 HTTP 方式。HTTP 接口接口手册见 docs/http/README.md。默认监听127.0.0.1:1224主要端点端点用途/api/ocrBase64 图片 OCR/api/ocr/get_options查询当前引擎支持的全部识别参数/api/doc/upload→/api/doc/result→/api/doc/download文档识别三步流程上传、轮询结果、下载产物/api/qrcode二维码识别Base64/api/qrcode/text文本生成二维码图片/argv把任意命令行参数转成 POST 请求执行仅本地环回可访问两条实践提醒后端并发能力有限请串行调用长时大批量调用偶发ECONNREFUSED重试即可。仓库里附有可直接运行的示例docs/http/api_doc_demo.pyPython 版文档识别全流程和 docs/http/api_doc_demo.html网页版改改参数就能嵌进你自己的系统。调优手册全局设置与引擎选择全局设置页能调什么语言简中、繁中、英语、日语等十余种手动切换入口在全局设置 → 语言/Language也支持新增语言主题与字体多套亮/暗主题、界面大小比例、字体均可改快捷方式一键添加桌面快捷方式、开始菜单项、开机自启渲染器默认走显卡加速遇到截屏闪烁、UI 错位时在这里切换渲染方案或关闭硬件加速OCR 插件在这里切换识别引擎。引擎怎么选Umi-OCR 支持两种离线引擎插件RapidOCR兼容性好、资源占用低适合老机器和 Win7 环境日常够用PaddleOCR速度稍快、大文本场景表现更稳默认内存占用不超过系统内存一半。不确定就先装默认版用着后续想换引擎导入对应插件即可不必重装。性能建议可直接照做长图、超大图识别慢或被截断时去页面设置里把限制图像边长调大默认 960调高保留更多细节几百张以上的任务分批跑跑完自动关机避免长时间占着机器批量跑图时顺手关掉其他吃内存的应用对排版要求高多栏文章、代码时花 10 秒选对文本后处理方案比调引擎参数收益更大。故障排查速查现象可能原因解决办法启动提示缺少 DLL缺少 Visual C 运行库安装 Visual C Redistributable 运行库截屏时画面闪烁、UI 错位显卡加速渲染不兼容全局设置 → 界面和外观 → 切换渲染器或关闭硬件加速结果里混入水印/页眉文字干扰区域没排除批量页右栏打开忽略区域编辑器画框包住干扰区注意只有整块文本在框内才会被忽略大图识别慢或细节丢失默认边长限制 960 会压缩图片设置中调高限制图像边长数值命令行指令无反应HTTP 服务未开启全局设置中允许 HTTP 服务主机选仅本地HTTP 调用偶发 ECONNREFUSED后端并发能力有限改为串行调用失败直接重试识别结果不准图片清晰度不足或引擎/排版方案不匹配提高图片质量换引擎或改用单栏-保留缩进等后处理方案生态与贡献插件化架构发行包内UmiOCR-data/下分main.py入口、py_src/Python 源码、plugins/OCR 引擎等插件、i18n/翻译文件几个目录引擎即插件——这正是同一套界面可切换 RapidOCR / PaddleOCR的原因。想加新引擎、新输出格式或后处理逻辑从插件仓库找模板入手即可。翻译协作界面本地化基于 Weblate 平台进行入口见项目官方页面仓库内的 dev-tools/i18n/ 目录提供了lupdate_all.py、convert_ts_txt.py等翻译工具链已有简中、繁中、英语、日语、葡萄牙语、俄语、泰米尔语等语言包。获取更新关注项目的 Releases 发布页即可拿到稳定版版本节奏参考 CHANGE_LOG.md例如 v2.1.5 新增了日志机制、--reload指令并优化了数万文件级目录的加载性能。接下来会发生什么项目公开的开发计划包括独立的数学公式识别与 LaTeX 渲染、表格识别并输出 Excel、GPU 加速的离线 OCR、图片/离线翻译、固定区域识别、历史记录系统、更新检查机制以及对 macOS 与更多 Linux 发行版的兼容。与其等路线图兑现不如现在就把最新发行版解压出来挑一份带水印的扫描 PDF 扔进文档识别页——画两个忽略区域跑一次任务你大概就知道它值不值得常驻在你的工具栏里了。【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片PDF文档识别排除水印/页眉页脚扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表