ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

4步跑通Umi-OCR:免费离线OCR从截图到批量PDF识别实战教程

4步跑通Umi-OCR:免费离线OCR从截图到批量PDF识别实战教程 4步跑通Umi-OCR免费离线OCR从截图到批量PDF识别实战教程【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片PDF文档识别排除水印/页眉页脚扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCRUmi-OCR 是免费开源的离线OCR工具截图取字、批量识别、扫描版PDF转可搜索文档全程不联网、图片不上传。读完你能跑通截图识别把一整个文件夹的扫描图批量出结果。Umi-OCR 离线OCR主界面左侧截图预览可直接划选文字右侧按时间保存识别记录4 步跑通从安装到第一次出结果解压发布包。发布版是.7z压缩包Windows 7 x64 和 Linux x64 都能用没有安装器。你会看到一个解压出的完整目录里面就是全部文件。启动程序。Windows 双击Umi-OCR.exeLinux 运行umi-ocr.sh。你会看到主窗口弹出界面语言跟随系统设置。唤起截图。打开截图 OCR标签页按快捷键可在该页设置里改鼠标框选一块文字区域。你会看到屏幕变暗、出现选框随时可按Esc取消。复制文字。识别完成后右侧记录面板会出现一段文本。点一下记录就能复制左侧预览栏也能直接用鼠标划选。全局设置页切换界面语言与主题或添加桌面快捷方式、开机自启最短路径到此就通了截图 → 识别 → 复制。从截图里抠出带缩进的代码谁会用文档截图、视频帧里的代码想贴进 IDE手敲太慢普通 OCR 还会吞掉缩进。操作在截图 OCR标签页框选代码区域。右侧设置面板里把排版解析选成单栏-保留缩进。等识别完成在记录里选中这条结果复制。你会看到记录面板新增一条结果。验收把结果贴进 IDE 或 Markdown 预览。缩进层级、行内空格与原图一致就算过关。避坑缩进被拍平成一段 → 默认排版解析多栏-按自然段换行面向普通文档 → 代码截图一律改选单栏-保留缩进。想改错字却只能整段复制 → 记录默认是识别原文 → 选中记录先编辑再复制。截图 OCR 页面右侧设置里切换排版解析方案左侧预览栏可划选文字记录面板还支持划选多条记录批量复制识别记录面板右键菜单可复制、删除单条记录或清空全部一文件夹扫描件批量转文本和Excel谁会用手里一堆扫描文档或票据图片一张一张点不现实。操作切到批量 OCR标签页点选择图片或直接拖入文件夹。你会看到左侧文件列表逐张列出几百张也能一次导入。核对输出格式勾选txt / jsonl / md / csv (Excel)。点开始任务。你会看到左侧列表逐张显示耗时和置信度。PDF 扫描件切到文档识别标签页v2.1.4 及以上支持拖入pdf / xps / epub / mobi / fb2 / cbz。产物是双层可搜索 PDF原图在底下识别出的文字藏在上层。验收随机抽 3 张图对比左侧预览和右侧记录。置信度0~1低于0.8的几张重点人工核对。PDF 产物用CtrlF搜一个只有正文里才出现的词能跳到对应页就对了。避坑每张图固定位置都有水印文字 → 水印的文本块被一起识别 → 右侧设置进入忽略区域编辑器按住右键画矩形框住水印框画得稍大更安全。像素超大的长图、小字多的大图认错字 → 默认边长限制先把大图压缩了 → 到设置 → 文字识别 → 限制图像边长把数值从960调高到 2880 或 4320。批量 OCR 页面左侧文件列表含耗时与置信度右侧是识别记录把识别接口挂进自己的脚本和流水线谁会用想把 OCR 放进定时任务、打包脚本或自己的 Web 服务里。操作在全局设置确认 HTTP 服务已开启主机保持仅本地即可默认端口1224。命令行走法umi-ocr是Umi-OCR.exe的简写完整用法见 docs/README_CLI.mdumi-ocr --screenshot --clip umi-ocr --path D:/docs --output 结果.txtHTTP 走法先GET http://127.0.0.1:1224/api/ocr/get_options查参数定义再POST http://127.0.0.1:1224/api/ocr提交 base64 图片。请求体里base64字段放图片编码options字段放语言模型、排版解析等选项完整参数表见 docs/http/api_ocr.md以官方文档为准。验收命令行跑完文本出现在剪贴板或你指定的文件里。浏览器访问get_options能看到 JSON 参数定义看到就说明服务通了。避坑命令行 / HTTP 没反应 → 九成是 HTTP 服务没开 → 回全局设置允许 HTTP 服务主机选仅本地。跑命令行任务时主窗口弹出来 → 命令行沿用截图 OCR标签页的参数设定 → 在那个标签页里关掉弹出主窗口选项。关键参数速查参数默认值什么时候需要改改成什么排版解析多栏-按自然段换行识别代码截图单栏-保留缩进限制图像边长960大图、小字多2880 或 4320语言/模型库简体中文纯英文、纯代码内容models/config_en.txtOCR 引擎插件Rapid-OCR自带速度或精度不够用全局设置里切换其他引擎插件所有界面改动会自动存进UmiOCR-data/.settingsini 格式也可以手动改改完执行umi-ocr --reload重新加载。排障速查现象大概率原因一句话解法识别顺序错乱、读不通默认排版解析不适合该图排版换排版解析方案代码选单栏-保留缩进大图里的小字认错边长限制 960 先压缩了图片限制图像边长调到 2880 以上水印、LOGO 文字混进结果水印里的文本块被一起识别批量页忽略区域编辑器里把水印整块框住命令行 / HTTP 没反应九成是 HTTP 服务没开全局设置里允许 HTTP 服务主机选仅本地界面语言不对首次启动没跟随上系统语言全局设置里手动切换语言Umi-OCR 像个放在本地的 OCR 工具箱免费、不联网截图、批量、PDF 一次做完还留了命令行和 HTTP 两个口子给你接自动化。建议先在截图页练熟排版解析再去批量页处理文件夹最后把接口挂进脚本。完整参考见 docs/README_CLI.md 与 docs/http/README.md。【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片PDF文档识别排除水印/页眉页脚扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表