
如何让 AI 看懂你的屏幕OmniParser 纯视觉屏幕解析完整实践指南【免费下载链接】OmniParserA simple screen parsing tool towards pure vision based GUI agent项目地址: https://gitcode.com/GitHub_Trending/omn/OmniParser想让大模型直接操作你的电脑它卡住的第一步往往是“看懂屏幕上有什么”。OmniParser 是一个纯视觉的屏幕解析工具给它一张截图它找出所有可点击元素输出一份带坐标和文字描述的清单不需要你深入目标应用内部的任何接口。先说问题AI 看得到屏幕但指不准把截图直接丢给多模态大模型它能告诉你“右下角有个登录按钮”但给不出稳定可点击的坐标界面一密集就容易张冠李戴。传统路线则是另一个极端UI 自动化框架依赖应用内部的接口、DOM 或无障碍树界面一改脚本就失效还得为每个应用重新摸索结构。OmniParser 走的是中间路线——把屏幕当成一张“要读的图片”先把画面翻译成模型可用的结构化列表。维度传统 UI 自动化OmniParser纯视觉依赖什么应用内部接口或 DOM只要一张截图维护成本界面变了就要改视觉特征不变即可继续用适用范围依赖目标系统支持任何能截屏的界面包括虚拟机里的系统上手成本逐个应用学结构一套模型解析整块屏幕一张截图它做了三件事 ⚙️看核心实现 util/omniparser.py一块屏幕要经过三步检测可交互区域内置的 YOLOv9 检测器先找出按钮、输入框等可点击位置的候选框。读取文字OCR 提取屏幕上的文本与检测出的框做归并。描述每个元素描述模型Florence-2给每个图标写一句短描述比如“放大镜图标”。三步拼起来就是一份带编号、带坐标的元素清单——相当于一份给大模型看的“屏幕翻译”。先看解析效果把屏幕上每个可点的地方编号拿一张搜索结果页截图跑一遍效果是这样每个搜索框、标签页、按钮都有框线和编号页面各区域旁边跟着简短描述。这意味着大模型不必再从像素里猜位置——它只需要说“点第 47 号”就够了落地点击的精度由解析结果保证。从安装到出效果3 步跑起来 git clone https://gitcode.com/GitHub_Trending/omn/OmniParser python gradio_demo.py克隆仓库后按 README 装依赖、把检测和描述两组权重放进weights目录再执行第二条命令就能打开 Gradio 页面。上传截图即可看到解析结果不满意时可以拖动两个滑杆调整灵敏度——Box Threshold 控制检测阈值IoU Threshold 控制重叠框的过滤。拿不准参数怎么调的话参考 demo.ipynb 里的几个现成例子。再进一步把任意大模型变成会操作屏幕的 Agent 解析只是第一步。项目里的 OmniTool 把“解析后的屏幕 大模型”接成了一个闭环你在对话框里输入一句自然语言指令OmniParser 截图并解析大模型决定对哪个编号的元素做什么动作系统执行后再截屏、再解析如此循环直到任务完成。图中左侧能看到大模型的分析过程和各步耗时解析一张屏幕大约 0.6 秒大模型推理约 13 秒——瓶颈在模型思考而不在看屏幕。OmniTool 的目标环境是一台 Windows 11 虚拟机开箱支持 GPT-4o、DeepSeek R1、Qwen 2.5VL 等一组视觉大模型上手前值得留意的几个细节评测数据docs/Evaluation.md 记录了项目在 ScreenSpot Pro 基准上的评测配置与结果V2 版本拿到了 39.5% 的成绩想验证“指得准不准”可以先看这份文档。版本演进V1.5 起支持更细的小图标检测并会判断每个元素是否可交互V2 是当前主线。授权检测器基于 MIT 协议的 YOLOv9 实现描述模型也是 MIT接到自己的项目里法律风险较小。从哪一步开始只想看效果先跑 Gradio 演示上传一张自己桌面的截图看看解析清单长什么样这一轮就够理解它怎么用。想把它接进自己的 Agent先读一遍demo.ipynb的例子再看 OmniTool 是怎么把解析结果喂给大模型的。仓库更新比较频繁2026 年还加入了新的检测权重建议顺手把仓库的更新说明加进关注列表。【免费下载链接】OmniParserA simple screen parsing tool towards pure vision based GUI agent项目地址: https://gitcode.com/GitHub_Trending/omn/OmniParser创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考