十年匠心定制 · 商业建站与技术教学双线并行 咨询热线:400-886-1026 service@lmnt.cn
ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

3步跑通 OmniParser:纯视觉 GUI 解析,让屏幕操作不再靠猜

3步跑通 OmniParser:纯视觉 GUI 解析,让屏幕操作不再靠猜 3步跑通 OmniParser纯视觉 GUI 解析让屏幕操作不再靠猜【免费下载链接】OmniParserA simple screen parsing tool towards pure vision based GUI agent项目地址: https://gitcode.com/GitHub_Trending/omn/OmniParser写自动化脚本时最让人头疼的是目标程序一更新按钮挪个位置脚本就失灵了。游戏里的技能按钮总点歪自动测试的坐标全对不上你只能重新抓一遍元素下周再来一次。OmniParser 是微软开源的一款纯视觉 GUI 解析工具思路完全不同——它只看屏幕截图把界面上的图标、文字、可点击区域解析成一份结构化清单再交给大模型决定下一步动作。核心能力输入任意一张 GUI 截图输出带编号框选的解析图每个元素都有位置坐标结合 OCR 文字识别与图标功能描述把这里能干什么讲清楚不依赖应用内部接口界面长得没变识别就不会变最小部署步骤克隆仓库git clone https://gitcode.com/GitHub_Trending/omn/OmniParser创建 Python 3.12 环境并激活conda create -n omni python3.12安装依赖conda activate omni pip install -r requirements.txt下载检测与描述模型权重到weights目录用huggingface-cli download拉取 YOLOv9-E 检测模型和 Florence caption 模型仓库 README 里有现成命令最后运行python gradio_demo.py启动演示。跑通后你会看到上传一张桌面截图页面返回一张带编号框选的标注图旁边列出每个图标的位置和一句话功能说明。技术亮点为什么换版本也不容易失效它全程只吃截图像素不接触应用内部的控件树和接口。只要界面元素长得没变识别结果就不受影响。游戏升个补丁、应用换个版本坐标漂移的问题基本不存在脚本维护成本降得很低。识别精度靠哪三个模型拼出来第一步用 YOLOv9-E 检测可交互区域把按钮和图标框出来第二步用 OCREasyOCR 或 PaddleOCR把界面上的文字定位出来第三步让 Florence-2 给每个图标写一句功能描述。三路结果交叉比对后输出带编号的结构化元素列表精度就是这么堆出来的。从看懂屏幕到动手操作配套的 OmniTool 把 OmniParser 和视觉大模型放进一台 Windows 11 虚拟机里配合使用从看懂屏幕到执行操作构成完整闭环。虚拟机环境用 Docker 脚本 一条命令就能拉起来。更多落地场景GUI 回归测试用屏幕元素解析代替坐标硬编码控件挪位后测试脚本照样能跑智能体训练数据生产用 OmniParser 加 OmniTool 记录操作轨迹本地落盘后直接作为自动化测试或智能体训练的数据集写在最后OmniParser 把看懂屏幕这件事从代码层挪到了视觉层坐标漂移、接口变化带来的维护负担明显变轻。花 5 分钟跑一遍gradio_demo.py传一张自己桌面的截图就能直观感受屏幕解析的实际效果。【免费下载链接】OmniParserA simple screen parsing tool towards pure vision based GUI agent项目地址: https://gitcode.com/GitHub_Trending/omn/OmniParser创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表