
UI.Vision RPA从零开始网页自动化的保姆级体验报告【免费下载链接】RPAUi.Vision Open-Source RPA Software with Computer Vision, OCR, Anthropic Computer Use/LLM. Selenium IDE import/export.项目地址: https://gitcode.com/gh_mirrors/rp/RPA如果你第一次听说 UI.Vision RPA也就是 Ui.Vision一句话介绍它是一款完全免费、开源透明的浏览器自动化工具靠计算机视觉 OCR 文字识别 AI 大模型三层能力帮你把网页和桌面上的重复操作自动跑起来。它特别适合三类人被表单和录入折磨的普通办公族、想快速回归测试的前端开发者、以及刚接触 RPA 想低成本试水的新手。每天打卡式地填同一张表、重复点击同一个按钮、反复把数据从 A 系统搬到 B 系统——这些事你早就不想做了。过去想自动化要么被商业 RPA 的报价吓退要么被脚本门槛拦住。这篇指南不堆术语只带你完成一件真实的小事把打开页面 → 输入内容 → 点按钮 → 验证结果这条最经典的自动化流程从头到尾亲手跑通一遍。读完你就知道这件事比想象中简单得多。为什么是它免费只是表面真正的杀手锏是看得见先亮明一个反直觉的结论UI.Vision RPA 最大的卖点不是免费而是它对找不到元素这件事有完全不同的解法。传统自动化靠 CSS 选择器或 XPath 找元素也就是给网页元素写门牌号页面一改版门牌号就失效脚本跟着崩。UI.Vision 的做法是直接看——用截图匹配找元素用 OCR 读屏幕上的文字甚至让 AI 理解右上角那个蓝色的保存按钮这种人类描述。这意味着哪怕按钮位置变了、样式重做了脚本往往照样能跑。这个思路贯穿了整个工具打开侧边栏新建一个宏宏就是一个自动化脚本录下你的操作回放时它靠视觉而非固定坐标来定位。对于动态网页和桌面应用这套看得见的方案比老派脚本稳得多。第一关装好它三个浏览器通用安装没有门槛两个途径任选。途径一浏览器商店直接装推荐。打开 Chrome、Edge 或 Firefox 的扩展商店搜索 UI.Vision RPAFirefox 里也叫 RPA点添加到浏览器即可。这是官方推荐方式装完就能用个人和商业用途都完全免费。途径二从源码构建进阶。如果你要改代码或做二次开发才需要自己构建git clone https://gitcode.com/gh_mirrors/rp/RPA cd RPA npm i -f npm run build构建产物会出现在dist目录Chrome/Edge 用和dist_ff目录Firefox 用然后在浏览器的扩展管理页加载已解压的扩展程序即可。注意日常使用完全不需要走这条路这段命令只写给想深入源码的开发者。构建相关说明都在仓库根目录的README.md里。第二关录制第一个宏全程不用写代码装好后点击浏览器工具栏的 UI.Vision 图标侧边栏会展开一个宏编辑器。点击录制新宏然后正常操作网页——比如填表单、点按钮——你的每一步都会被自动翻译成一条条命令存进一个表格里。这个表格就是你脚本的乐高积木每一行是一条命令比如open打开网址、type输入文本、click点击元素。录完点停止宏就保存好了。回放时工具会像放电影一样把刚才的操作重演一遍。想手动加一条命令也很直观直接在表格里选命令、填参数。比如最基础的三板斧open | https://example.com // 打开网页 type | idusername | your_name // 在输入框里填内容 click | idsubmit // 点击提交按钮每行发生了什么一目了然第一行跳转页面第二行往 id 为 username 的输入框写入文本第三行点下提交。不需要理解任何框架命令本身就是可读的英文短句。第三关处理脚本最怕的意外靠视觉和 OCR网页自动化最烦的情况弹窗时有时无、元素偶尔加载慢、按钮位置变了。UI.Vision 为这类场景准备了三个工具按需取用。视觉搜索区域。如果目标元素总在屏幕某一块区域出现你可以先用截图框出搜索范围再让工具只在区域内找目标。这个功能叫visionLimitSearchArea在命令下拉框里选它配合截图指定区域即可。界面直观选好区域就能看到配置面板这张图告诉你视觉定位不是玄学就是框一个区域、选一条命令这么简单。区域既可以作用于浏览器页面也可以作用于整个桌面。OCR 文字识别。当目标只有文字、没有可点击的元素时比如 Canvas 画布、跨域页面里的按钮直接用 OCR 按文字找ocrFindText | 确认就能点中确认按钮。白话解释OCR 就是让工具读懂屏幕上的文字再按文字去点击。AI 兜底。如果页面风格太花哨、文字变形本地 OCR 读不出来还能让 AI 理解自然语言描述——这是项目内置的 Anthropic 大模型能力直接说点那个蓝色的接受按钮就能执行。这部分能力对应的源码在src/services/ai/目录下想了解 AI 是怎么被接进自动化的可以从这里读起。第四关一个真实场景的完整回放纸上谈兵不如看实战。下面这张截图展示的是 UI.Vision 在课程平台上的真实自动化测试录制脚本去编辑课程内容、操作编辑器里的文本框和媒体组件然后发布。这张图告诉你自动化面对的不是抽象示例而是这种有侧边栏、有编辑器、有工具栏的复杂页面。有了视觉定位即便课程改版、按钮挪位脚本依然能准确命中目标。这条流程对应的命令模式其实还是老三样click点开课程 →type输入编辑内容 →click发布。把这三步录成宏配上判断和循环就能批量处理几十门课程这是录制功能带来的直接效率飞跃。第五关从能跑到写脚本进阶只差一步录制生成的表格命令对应着一套等价的 JavaScript APIuiv.*。当你需要更复杂的逻辑时可以直接写脚本——注意这里不是让你手写全部代码而是在录制的基础上用代码补上条件判断错误处理这些录制做不到的部分。uiv.*API 的哲学很有意思每个查找操作都会自动等待元素出现失败时直接抛出异常所以try/catch就能优雅处理弹窗没出现这类情况。比如var x uiv.findImage(close.png, { required: false, timeout: 2 }); if (x) uiv.browser.click(x); // 关闭按钮出现就点掉没出现就跳过这段代码做的事在 2 秒内找关闭按钮的截图找到就点击找不到就安静跳过——完美应对这个弹窗偶尔才出现的场景。uiv.*API 和表格命令的完整对照表仓库根目录的uiv-commands.md里一应俱全想系统学习脚本写法的人可以对照查阅。第六关AI 时代的自动化还能怎么玩2026 年的 RPA 工具如果只做录制回放已经不够看了。UI.Vision 的想象力在于它把 AI 直接嵌进了工作流AI 对话生成宏侧边栏内置 AI 对话用大白话描述需求比如每天打开报表页导出 CSV 保存到本地AI 能直接生成可运行的宏。MCP 桥接项目提供了 MCP 服务端源码在mcp/目录说明文档见mcp/README.md让 Claude Code 这类 AI 编程工具可以直接调用浏览器里的宏能力——AI 负责生成和修改宏浏览器负责执行分工明确。AI 视觉定位前面提过的uiv.ai.find用大模型理解人类式描述来定位元素。如果你想让 AI 在浏览器里干活可以延伸出一个扩展模块安装流程。项目的扩展能力通过 XModule 实现安装时需要在几个 JSON 配置文件里登记扩展 ID然后运行批处理脚本。安装过程是这样的这张图告诉你模块化扩展并不神秘——左边是文件目录右边是配置文件把扩展 ID 填进allowed_origins再运行安装脚本就完成了。想给工具加原生文件访问、桌面操作等能力走这条路就行。行动清单读完这篇你可以立刻做的三件事装扩展打开浏览器商店搜索 UI.Vision RPA安装完事。录第一个宏找一个你每天重复做的网页操作录制、回放感受第一次全自动的快乐。试一次视觉定位用visionLimitSearchArea框一个区域让脚本在区域内找元素体验页面改版也照样跑的稳定性。想深入研究的仓库里这三个入口足够你按图索骥src/actions/是全部可用命令的定义src/modules/是脚本运行与命令解释的核心逻辑uiv-commands.md是表格命令与 JS API 的完整对照表。最后说句掏心窝的话这类工具解决的是效率问题而不是替代人的创造力。把那些重复、机械、毫无成就感的操作交给它你省下来的时间恰好是留给真正需要你判断和创意的事。自动化从来不是为了淘汰人而是让人从做表格里解脱出来去做用表格的事情。从今天录下的第一个宏开始你的重复工作正在变成历史。【免费下载链接】RPAUi.Vision Open-Source RPA Software with Computer Vision, OCR, Anthropic Computer Use/LLM. Selenium IDE import/export.项目地址: https://gitcode.com/gh_mirrors/rp/RPA创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考