十年匠心定制 · 商业建站与技术教学双线并行 咨询热线:400-886-1026 service@lmnt.cn
ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

把屏幕截图读成结构化元素:OmniParser 如何让 GUI 代理不再点错

把屏幕截图读成结构化元素:OmniParser 如何让 GUI 代理不再点错 把屏幕截图读成结构化元素OmniParser 如何让 GUI 代理不再点错【免费下载链接】OmniParserA simple screen parsing tool towards pure vision based GUI agent项目地址: https://gitcode.com/GitHub_Trending/omn/OmniParserOmniParser 是一款纯视觉的屏幕解析工具它吃进一张界面截图吐出带坐标、带语义的结构化元素列表让 GPT-4V 这类模型生成的操作指令能稳稳落到正确的按钮上。三步跑通 demo 最简启动路径就三步不展开原理git clone https://gitcode.com/GitHub_Trending/omn/OmniParser进入目录后安装依赖pip install -r requirements.txt起演示应用python gradio_demo.py跑起来后打开 Gradio 界面丢一张截图进去它直接回显带框选的元素图加一份结构化清单。它到底解决了什么问题想象一个场景你让视觉模型点一下搜索框它只看见一张像素图却不知道搜索框的边界在哪、算不算可点。结果就是点偏、点到相邻按钮或者干脆漏掉目标。OmniParser 的做法是把这张图拆成三层再拼回来YOLOv9 先框出所有可交互区域源码在 util/yolov9.pyFlorence-2 再给每个图标补一句功能描述OCR 负责抽取文字块。管线最终输出一张带编号的 Set-of-Mark 图加一段icon 0: ...的结构化列表把这块能点、它叫保存、坐标在这里一次讲清。这一步把模糊的视觉理解变成可索引的元素清单代理的每个 action 都有了明确落点点错率自然降下来。多窗口下的实际表现 ⚡单张截图解析快只是基础真正考验在复杂桌面。多开窗口、多标签页时解析依然按元素逐个定位不糊成一片。官方在 ScreenSpot Pro 这个 grounding 基准上拿到 39.5%是当时的领先成绩评测脚本与推理日志都开放在 eval/ 目录可复现、可对照。不只能做 GUI 代理自动化测试用解析结果断言某个按钮现在长什么样、在哪不依赖控件树界面改版也不容易崩。数据采集配合 OmniToolomnitool/能本地记录轨迹给自家 agent 攒训练数据。办公场景识别 Excel、Word、OneNote 这类界面元素做信息抽取。把截图当结构化数据来读这件事在很多看得见但读不懂的地方都能复用。OmniParser 的价值就是把看屏幕这件模糊的事变成读清单这件确定的事。有兴趣的话先从gradio_demo.py跑起来丢张自己的截图表看看解析结果。【免费下载链接】OmniParserA simple screen parsing tool towards pure vision based GUI agent项目地址: https://gitcode.com/GitHub_Trending/omn/OmniParser创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表