
UI.Vision RPA自动化从零到一实战指南把重复劳动交给免费开源工具【免费下载链接】RPAUi.Vision Open-Source RPA Software with Computer Vision, OCR, Anthropic Computer Use/LLM. Selenium IDE import/export.项目地址: https://gitcode.com/gh_mirrors/rp/RPA如果你每天都要在网页上重复填表、复制粘贴、点击保存那么这篇RPA自动化实战指南就是为你准备的。UI.Vision RPA 是一款完全免费、开源可审计的浏览器扩展支持 Chrome、Edge 与 Firefox能录制你的操作并自动回放还内置了计算机视觉、OCR 文字识别和 AI 智能操作能力。别被机器人流程自动化这个名词吓到——简单说它就是一个替你在浏览器里干活的工具而你需要做的只是把操作演示一遍。先从一段真实经历说起我有个做运营的朋友每天下午雷打不动要做一件事把 Excel 里的几十行数据一条条粘贴到后台系统每粘贴一条都要切换窗口、找输入框、点保存。有一次他在第 23 行复制错了单元格前面二十多条记录全部作废重新来一遍又花了四十分钟。这种看起来简单、做起来要命的重复劳动几乎每个岗位都有财务要批量导账单、HR 要逐个查社保、客服要重复填工单。这正是 UI.Vision RPA 的用武之地。它是一款开源的 RPA 自动化软件RPA 即 Robotic Process Automation翻译过来是机器人流程自动化你可以理解成让软件替你操作软件核心能力包括三块网页操作录制与回放你手动操作一遍它生成脚本之后每次自动执行计算机视觉定位按图片长相找界面元素页面改版也不怕OCR 文字识别与 AI直接读屏幕上的文字甚至可以让大模型看着屏幕帮你做决策、替你点击。它还兼容 Selenium IDE——如果你以前接触过 Selenium 这套测试工具脚本可以直接导入导出几乎零学习成本迁移。30 秒判断它适不适合你先给一张速览表看完你就能决定要不要继续读下去亮点一句话说明上手成本录制即得脚本在页面上操作一遍命令自动生成不写代码极低计算机视觉定位按图片特征找元素UI 微调也能稳定命中低OCR 文字识别直接读屏幕上出现的文字并执行操作低AI / LLM 驱动大模型看屏幕、下指令、自动点击中等Selenium IDE 兼容命令可导入导出老脚本直接复用低跨平台跨浏览器Chrome / Edge / FirefoxWin / macOS / Linux低开源且免费AGPL-3.0 协议个人与商业用途均免费—如果你符合下面任意一条它就是为你准备的每天有超过半小时的重复网页操作且这些操作逻辑固定不想为了自动化专门去学一门编程语言目标系统没有提供 API只能靠人肉点鼠标。反之如果你的任务是一次性的、页面每天都在大改或者你更需要的是数据爬取而不是模拟操作那它可能不是最优解。10 分钟跑通第一个自动化任务下面我们做一个完整闭环安装 → 录制 → 回放 → 验证结果。任务很接地气——把登录后台 → 输入查询条件 → 点击查询这条流程变成一条一键运行的宏宏就是一条自动化脚本你可以理解成录好的操作合集。第 1 步安装扩展最省事的方式是直接去 Chrome、Edge 或 Firefox 的扩展商店搜索 UI.Vision RPA 点安装全程免费。如果你习惯从源码构建可以克隆仓库https://gitcode.com/gh_mirrors/rp/RPA然后依次执行npm i -f npm run build构建产物会出现在dist目录Firefox 对应dist_ff打开chrome://extensions开启开发者模式点击加载已解压的扩展程序选中该目录即可。小提示只是日常使用的话完全不需要构建商店装完就能用。源码构建是给想改功能、做二次开发的人准备的。第 2 步打开录制器点击浏览器工具栏上的 UI.Vision 图标在弹出的面板里选择录制新宏浏览器就会进入录制状态——注意从这一刻起你做的每一步都会被记录。第 3 步在页面上手动操作一遍正常去你的目标网站把想自动化的流程走一遍。比如打开一个课程管理后台在左侧选中课程、在中间编辑区改内容、最后点发布这一步的目的很单纯你不需要用嘴描述流程做一遍就够了。录制器会自动判断你点了哪里、输入了什么。第 4 步停止录制看看生成的命令表操作完毕后点击停止你会看到刚才的每一步都被翻译成了一行命令格式是命令 | 目标 | 参数open | https://example.com/admin type | idusername | demo type | idpassword | 123456 click | idloginBtn waitForPageToLoad | 30000 click | idsearchBtn是不是有点像自然语言type就是往输入框里打字click就是点击waitForPageToLoad就是等页面加载完成。这些命令的定义都在项目的 src/actions/ 目录里想了解支持哪些命令可以翻一翻。第 5 步回放并验证点击播放按钮浏览器会自动重复你刚才的操作。首次建议用单步执行一步步走确认每行命令都执行正确没问题后再整条播放。到这里你已经跑通了 RPA 自动化的完整闭环。⚡️第 6 步处理不听话的元素进阶预演播放过程中你大概率会遇到一个问题某个按钮在页面上找不到了。原因通常是元素被加了动态样式、登录状态不同导致按钮文字变化等。这时候就要请出 UI.Vision 的招牌能力——视觉识别。你可以截图指定一个搜索区域让工具按图像特征而不是HTML 位置去找元素如上图绿色区域是命令配置区你可以为findImage这类命令指定目标图片和搜索范围工具会在指定区域内扫描匹配。这种定位方式比传统的 CSS 选择器稳定得多是处理动态网页的关键手段。进阶玩法与避坑清单跑通第一个宏之后下面是几个能明显提升效率的技巧以及新手最容易踩的坑。技巧一用 uiv.* JavaScript API 写真正的逻辑录制模式适合线性流程一旦遇到如果找不到就跳过循环处理多页这类逻辑就轮到 JavaScript 出场了。项目提供了完整的uiv.*API把 DOM 定位uiv.$、图像查找uiv.findImage、OCR 找字uiv.ocr.findText、AI 查找uiv.ai.find都封装成了同步函数失败会抛异常try/catch就能处理const btn uiv.findImage(search_button.png, { timeout: 10 }); if (btn) { uiv.browser.click(btn); } else { uiv.log(按钮图片没找到改用文字定位, orange); uiv.browser.click(uiv.ocr.findText(查询)); }每一条uiv.*调用都会自动等待元素出现超时才报错写起来非常省心。完整的命令对照表可以看仓库里的 uiv-commands.md它把每一行经典表格命令都映射到了对应的 JS 写法。技巧二能用 OCR 找文字就别死磕图片很多新手一上来就截图存模板其实 OCR 是更省事的方案按钮上的文字是读出来的界面改版、换主题、换屏幕分辨率都不会影响。缺点是 OCR 可能认错字所以第一次用某个文字定位前建议先跑一次OCR 覆盖层看看工具到底识别出了什么再决定用它做定位依据。技巧三用 XModule 把能力扩展到桌面应用UI.Vision 不止能操作网页。通过 XModule 扩展模块它可以操作浏览器之外的桌面软件截图、点击、输入实现网页 桌面混合流程。安装扩展模块需要把扩展 ID 写进几个 JSON 配置文件再运行对应的批处理脚本就像下图这样红箭头标的就是把扩展 ID 填进 4 个 JSON 文件再运行 3 个安装脚本的流程。相关服务源码在 src/services/xmodules/想深度定制可以去研究。技巧四让 AI 助手直接帮你写宏项目接入了 Anthropic 的 Computer Use / LLM 能力还有一套 MCP 桥接说明见 mcp/README.md。简单说你可以用自然语言描述需求让 AI 直接生成、修改甚至运行宏——它看着屏幕操作玩五子棋这类小游戏都能跑通。对不熟悉命令语法的用户来说这是最快的上手方式。新手最容易踩的 4 个坑坑一录制时不加等待回放时页面没加载完。解决在关键步骤后补waitForPageToLoad或显式的等待命令宁可多等一秒不要抢跑。坑二依赖固定坐标定位。窗口大小一变坐标就全错。解决优先用 CSS 选择器或视觉识别坐标只留给真没有其他办法的场景。坑三把 OCR 识别失败当成元素不存在。OCR 可能只是看错了而不是没看到。解决先开覆盖层确认识别结果再判断是改模板还是改文字。坑四用try/catch掩盖找不到而不是处理报错。两个语义完全不同找不到应该用{required: false}加空值判断try/catch是留给真正的异常的混用会让你排查问题时一脸懵。快问快答问录制好的宏换台电脑还能用吗能宏是独立文件导入导出即可跨浏览器跨系统都能跑。问能操作本机文件吗能项目内置了文件系统服务见 src/services/filesystem/可以读写本地文件、处理 CSV 数据。问免费版有什么限制吗官方说明是个人和商业用途都免费没有功能阉割。写在最后UI.Vision RPA 的价值不在于它有多少炫酷的功能标签而在于它把自动化的门槛降到了会用浏览器就能上手的程度录制解决 80% 的简单流程视觉识别和 OCR 解决界面不稳定的老大难JavaScript API 和 AI 解决最后 20% 的复杂逻辑。它是开源的AGPL-3.0代码就在仓库里随时可以审计不用担心闭源工具那种黑盒依赖。适合谁被重复劳动困住的运营、财务、客服、HR想给项目补自动化测试的开发者以及任何觉得我这点小事不值得写个程序的人——其实值得。接下来你可以做三件事先去浏览器商店把它装上录一条真实工作里的重复流程试试然后翻一翻仓库里的 uiv-commands.md 和 src/services/ 了解更深的能力最后把第一个宏跑通的那一刻你会发现自己省下的不只是那四十分钟而是每天多出来的一段完整时间。自动化的意义从来不是取代人而是让人从复制粘贴里腾出手来。现在轮到你开始了。【免费下载链接】RPAUi.Vision Open-Source RPA Software with Computer Vision, OCR, Anthropic Computer Use/LLM. Selenium IDE import/export.项目地址: https://gitcode.com/gh_mirrors/rp/RPA创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考