
GUI智能体UI-TARS实操指南让它替你点击与输入【免费下载链接】UI-TARSPioneering Automated GUI Interaction with Native Agents项目地址: https://gitcode.com/GitHub_Trending/ui/UI-TARS想让电脑替你点鼠标填表单却被自动化脚本劝退选择器一改界面就失效坐标全靠手标一条流程写半天。UI-TARS 是一个 GUI 智能体你给它一张截图加一句指令它回给你可执行的点击、输入和拖拽动作。本文用 3 步走通部署与后处理再讲原理和实测数据。一句话定位 3 个硬核数字UI-TARS-1.5 是基于视觉语言模型的开源多模态 GUI 智能体先输出 Thought 推理再输出 Action 操作能自主操作桌面、浏览器和 Android 模拟器。7B 开源权重单卡 L40S 48G 可部署OSWorld100 步拿到 42.5此前 SOTA 仅 38.1ScreenSpot-V2 元素定位 94.2%同类第一3 步跑起来第 1 步克隆仓库并安装解析工具包# 克隆 UI-TARS 仓库并安装解析包 git clone https://gitcode.com/GitHub_Trending/ui/UI-TARS pip install ui-tars预期结果得到 UI-TARS 目录codes/ 是动作解析库data/ 有示例对话消息ui-tars 包提供解析动作、生成 PyAutoGUI 脚本两个接口。第 2 步部署模型拿到第一次响应按 README_deploy.md 在 Hugging Face 上创建推理端点7B 建议 L40S 48G需设两个环境变量。预期结果输入截图和任务后返回一段Thought: ...加Action: click(start_box(x,y))的响应。第 3 步把响应解析成可执行脚本# resp 是模型输出的 ThoughtAction 字符串 from ui_tars.action_parser import parse_action_to_structure_output parsed parse_action_to_structure_output(resp, factor1000, origin_resized_height1080, origin_resized_width1920, model_typeqwen25vl)预期结果得到结构化动作列表含动作类型与坐标再传入 parsing_response_to_pyautogui_code 即得到可直接运行的 PyAutoGUI 脚本。原理速览架构图分上下两部分。上面 Environment 是一圈交互循环用户指令和截图进模型出 ThoughtActionPyAutoGUI 执行后再截图喂回去——相当于一个看屏幕、想一下、动手、再确认结果的工人循环到任务完成。下面 Capability 是四个模块Perception元素描述、密集标注、Set-of-Mark 定位。Set-of-Mark 可以理解为给屏幕上的元素贴编号小标签模型指着编号说话不容易点错Action统一动作空间click、type、hotkey、scroll 等加多步轨迹标注数据System-2 Reasoning用 GUI 教程和思维增广训练模型想清楚再动手这是 1.5 版先思考后行动的核心Learning from Prior Experience在线轨迹自举加 Agent DPO从自己过往成败轨迹里学习类似工作日志加复盘推理能力来自强化学习而不是规则模板同一个模型通吃桌面和移动端区别只在换一套提示词模板见 codes/ui_tars/prompt.py。它能做什么、不能做什么适合拿来做什么别指望它做什么桌面 GUI 自动化开应用、填表单、操作浏览器与办公软件游戏场景7B 版本未针对游戏优化移动端/Android 模拟器操作开应用、长按、返回、Home 键零成本运行7B 约需 48G 显存或云端端点元素定位的训练与评估GROUNDING 提示词只出 Action永远准确陌生环境偶有元素误识别与幻觉把模型输出转成 PyAutoGUI 脚本绕过验证码等受保护内容实测表现基准UI-TARS-1.5OpenAI CUAClaude 3.7此前 SOTAOSWorld100 步42.536.42838.1200 步Windows Agent Arena50 步42.1--29.8WebVoyager84.88784.187Online-Mind2Web75.87162.971AndroidWorld64.2--59.5定位基准UI-TARS-1.5OpenAI CUAClaude 3.7此前 SOTAScreenSpot-V294.287.987.691.6ScreenSpotPro61.623.427.743.6Poki 14 款小游戏里UI-TARS-1.5 有 13 款完成度 100%含 2048、snake-solver、wood-blocks-3dOpenAI CUA 与 Claude 3.7 的 100 分游戏均为 0 款。对比图覆盖 72B 与 7B 两个版本72B 在多数基准上领先此前 SOTA 5% 到 43%7B 与其差距不大雷达图中 7B 在 8 项基准上整体压过 GPT-4o 与 Claude。常见坑 FAQQ1HF 端点部署失败或大图请求被截断创建端点前先加两个环境变量CUDA_GRAPHS0避免部署失败PAYLOAD_LIMIT8000000防大图请求失败容器镜像用ghcr.io/huggingface/text-generation-inference:3.2.1最大输入长度设 65536。完整参数见 README_deploy.md。Q2点击坐标和屏幕位置对不上Qwen2.5-VL 系模型用绝对坐标图片进模型前先做 smart_resize边长取 28 的倍数总像素限制在 100×28×28 到 16384×28×28 之间输出坐标是缩放后图像空间里的值要乘原图尺寸 ÷ 缩放后尺寸才是实际点击点。README_coordinates.md 有完整代码下图红点就是映射后的落点。Q37B 最低显存门槛是多少不够怎么办官方推荐 L40S 48GL4、A100 也可。本地显存不够就改云端端点或先用开源 7B 跑通用电脑操作场景——OSWorld 27.5已高于 72B-DPO 的 24.6。扩展与引用README_deploy.md端点部署参数、环境变量与 API 调用示例README_coordinates.mdsmart_resize 实现与坐标落点可视化代码codes/ui_tars/action_parser.py动作解析与代码生成两个核心接口codes/ui_tars/prompt.py桌面、移动、grounding 三套提示词模板codes/README.mdui-tars 工具包 API 说明UI_TARS_paper.pdf技术报告article{qin2025ui, title{UI-TARS: Pioneering Automated GUI Interaction with Native Agents}, author{Qin, Yujia and Ye, Yining and Fang, Junjie and Wang, Haoming and Liang, Shihao and Tian, Shizuo and Zhang, Junda and Li, Jiahao and Li, Yunxin and Huang, Shijue and others}, journal{arXiv preprint arXiv:2501.12326}, year{2025} }【免费下载链接】UI-TARSPioneering Automated GUI Interaction with Native Agents项目地址: https://gitcode.com/GitHub_Trending/ui/UI-TARS创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考