同一个问题,三种答案
"找到页面上的提交按钮,点击它。"
把这句话丢给三个不同的开源 GUI Agent 项目,你会得到三种完全不同的实现路径:
- 一个会把整张截图丢给专门训练过的视觉定位模型,模型直接吐出坐标
(842, 613) - 另一个会去解析页面的 DOM 或无障碍树,找到
role=button, name="提交"的节点,直接调用它的点击事件 - 第三个不做任何专门的定位步骤,一个通用多模态大模型看着截图,直接决定"往这个坐标点一下"
这三条路线不是三个可以随意替换的实现细节,而是三种不同的架构决策,各自有清晰的适用边界和代价。这篇文章要建立的,是后面 12 篇案例拆解都会反复用到的一套词汇表——不这样做,每篇文章都要重新解释一遍"这个项目用的是哪种定位方式"。
路线一:像素视觉定位模型(Visual Grounding)
原理
这条路线把 GUI 当成一张图片。给模型一段自然语言描述("提交按钮")和一张截图,模型直接输出这个元素在图片里的坐标或边界框。
这是个专门的子任务,学术上叫 GUI grounding:不负责决策"接下来该做什么",只负责把一个自然语言引用精确地映射到屏幕坐标。代表性的开源模型有 UGround、Aria-UI,以及阿里 Mobile-Agent-v3 用的自研模型 GUI-Owl(后续文章会详细拆解)。
典型架构是两阶段的:
用户任务:"提交这个表单"
↓
规划模型(可以是通用 LLM):"下一步应该点击提交按钮"
↓
视觉定位模型(专用,如 UGround):"提交按钮"+ 截图 → 坐标 (842, 613)
↓
执行层:在 (842, 613) 处点击规划和定位是分开的两个模型,各自专精一件事。
优势与代价
优势:不依赖任何应用内部的结构化信息,纯粹靠"看",因此天然跨平台——网页、移动 App、桌面软件、甚至游戏界面,只要能截图就能定位。UGround 论文里报告的一个关键结果是:这条路线在多个 GUI 定位任务上比依赖无障碍树的方案(下面路线二)高出最多 20 个百分点的绝对准确率,原因是很多真实应用的无障碍树本身残缺或不可靠。
代价:
- 每次定位都要过一次视觉模型推理,比直接读结构化数据慢、贵
- 小元素、密集布局的定位精度会明显下降(下文 ScreenSpot-Pro 的数据会说明这一点有多严重)
- 定位模型本身需要专门训练和维护,不是"白嫖"一个通用大模型就能达到高精度
路线二:DOM / 无障碍树结构化理解
原理
这条路线不看图,看结构。网页有 DOM 树,桌面和移动应用有无障碍树(Accessibility Tree,操作系统为屏幕阅读器等辅助工具暴露的语义化视图)。把这棵树序列化成文本,直接交给 LLM 推理:"在这段结构里,哪个节点是提交按钮?"
一旦找到目标节点,后续操作不需要坐标——直接调用该节点暴露的 click()、setValue() 等接口,这是传统 Selenium / Playwright 脚本用的同一套机制,只是"找节点"这一步从写死的 selector 换成了 LLM 语义理解。
优势与代价
优势:
- 结构化数据是文本,token 成本远低于图片,速度也更快
- 定位精度不受屏幕分辨率、元素大小影响——只要节点在树里,语义匹配就是精确的
- 可以复用现有自动化框架的执行层(Playwright、Appium),改动集中在"定位"这一步
代价:
- 强依赖应用暴露的结构化信息是否完整可靠。 Canvas 渲染、WebView 内嵌页面、大量自定义渲染的移动端控件,往往在无障碍树里只是一个不透明的黑盒节点,没有任何语义信息可用——这时这条路线直接失效,必须退化到视觉方案
- 真实页面的 DOM/无障碍树可能非常庞大(现代 SPA 页面动辄几千个节点),全部塞进 LLM 上下文成本很高,需要做裁剪或降采样——这也是 "DOM Downsampling for LLM-Based Web Agents" 这类工作专门要解决的问题
- 不同平台的树结构差异很大(Web DOM、Android View 树、iOS UIKit 树),一套语义理解逻辑很难直接跨平台复用
路线三:Computer Use——纯坐标点击
原理
这是最"暴力",但也是过去两年商业化程度最高的路线:Anthropic 的 Computer Use、OpenAI 的 Operator/CUA 都属于这一类。
跟路线一的关键区别是:这里没有独立的"定位模型"这一步。 一个通用多模态大模型直接接收截图作为输入,直接输出下一步动作——"在 (842, 613) 点击"、"输入文本"、"按 Tab 键"——感知和决策是同一个模型一次完成的,不存在"规划模型 + 专用定位模型"的两阶段分工。
截图 → 通用多模态大模型(感知 + 决策一体) → 直接输出:click(842, 613)优势与代价
优势:
- 架构最简单——不需要维护额外的专用定位模型,也不需要解析任何平台特定的结构化数据
- 因为完全不依赖应用暴露的接口,理论上"能截图就能操作",是通用性天花板最高的路线,也是把 Agent 从"网页自动化工具"变成"操作电脑的通用助手"的技术基础
代价:
- 定位精度是三条路线里公开数据最差的——下一节的 benchmark 数字会说明这一点
- 延迟和成本最高:每一步动作都要过一次大模型的图片推理,而且往往需要连续多步才能完成一个任务,是三条路线里最"烫钱"的
- 缺乏结构化信息的兜底——路线二在结构可靠时可以做到接近 100% 精确,路线三没有这个上限保证,纯粹靠模型的视觉定位能力
用 Benchmark 量化三条路线的真实差距
光说"哪条路线更好"没有意义,几个公开 benchmark 给出了可以互相比较的数字。
ScreenSpot 系列:只测"定位"这一步
ScreenSpot 是最早的 GUI grounding 基准,任务简单直接:给一句自然语言指代和一张截图,模型要指出目标元素的坐标。领先模型在这个基准上已经能做到 90% 以上的准确率。
ScreenSpot-Pro 是它的加强版:截图全部来自真实的专业级桌面软件(如 CAD、IDE、数据分析工具),分辨率更高、界面元素更小更密集。同样的领先模型,分数掉到了 37.1%(这是 2025 年一批新模型里报告的最高分之一,多数模型远低于这个数字)。
基准 测什么 领先模型准确率
──────────────────────────────────────────────────
ScreenSpot 简单界面的元素定位 90%+
ScreenSpot-Pro 专业软件的元素定位 ~37%(最好情况)这个断崖式下跌说明了一个关键事实:"定位准确率"不是模型的固定属性,而是随界面密度和元素尺寸急剧衰减的。 这也是为什么移动端自动化(后续 05-09 篇会详细拆解)会格外看重"专用 grounding 模型"这条路线——手机屏幕上的图标往往比桌面软件的按钮更小、更密集。
OSWorld:测完整任务的端到端成功率
ScreenSpot 只测"找得到元素",OSWorld 测的是完整任务能不能做完——在真实操作系统环境里完成一个多步骤任务(比如"用 LibreOffice Calc 整理这份数据并导出 PDF"),涉及规划、定位、执行、纠错的全链路。
OSWorld 论文报告的人类基线是 72.36% 的任务完成率,而早期基线模型(如 GPT-4V)只能做到 12.24%——差距接近 60 个百分点,论文明确指出主要瓶颈是 GUI 定位和操作知识的欠缺,而不是任务理解本身。这个数字后来随着专用 Agent 架构(如 Agent S 系列)快速追赶——到 2025-2026 年,头部方案已经能做到 65%-70%+,逼近人类基线,但这是靠规划、反思、多次重试等 Agent 架构层面的工程手段补上的,不是单靠底层定位模型的进步。
人类基线 早期基线模型 2026 年头部方案
────────────────────────────────────────────────────────────
OSWorld 任务成功率 72.36% 12.24% ~65%-70%这组数字的意义:定位准确率和任务成功率是两件事。 定位模型再准,如果 Agent 不会在失败后重新规划、不会验证自己的操作是否达到了预期效果,端到端成功率照样上不去。这也是为什么后续讲移动端自动化项目(ARTEMIS、Mobile-Agent-v3 等)时,"规划+反思机制"会是跟"定位模型选型"同样重要的话题。
三条路线不是单选题
实践中,成熟的开源项目很少纯粹押注一条路线,常见的组合方式是分层兜底:优先尝试路线二(DOM/无障碍树,快且准),拿不到可靠结构化信息时,退化到路线一或路线三(视觉定位)。后续 08 篇要拆解的 AppAgent 就是这种"解析树 + 视觉特征双输入"设计的典型代表——两条路线不是互斥的技术选型,而是同一个系统里按可靠性排序的两级兜底。
概念词汇表(全系列复用)
| 术语 | 含义 | 后续会用到的文章 |
|---|---|---|
| GUI Grounding | 把自然语言引用映射到屏幕坐标/元素的任务 | 04-09 |
| 视觉定位模型 | 专门训练来做 GUI grounding 的模型(UGround、GUI-Owl) | 05, 07 |
| 无障碍树 / DOM 语义理解 | 解析结构化视图而非像素来定位元素 | 04, 08, 10 |
| Computer Use | 通用多模态模型直接输出坐标动作,无独立定位阶段 | 09 |
| ScreenSpot / ScreenSpot-Pro | 只测单步定位准确率的 GUI grounding 基准 | 05-09 |
| OSWorld / AndroidWorld | 测完整多步任务成功率的端到端基准 | 05-09 |
总结
- GUI 元素定位有三条技术路线:专用视觉定位模型(跨平台通用,但慢且贵)、DOM/无障碍树结构化理解(快且准,但依赖平台暴露可靠的结构化信息)、Computer Use 纯坐标点击(架构最简单、通用性最高,但定位精度天花板最低)
- ScreenSpot → ScreenSpot-Pro 的分数断崖(90%+ 掉到 37%)说明定位准确率会随界面密度急剧衰减,不是模型的固定能力
- OSWorld 的人类-模型差距(72.36% vs 早期基线 12.24%)说明端到端任务成功率不只取决于定位精度,规划和纠错机制同样关键
- 成熟系统通常做分层兜底而不是单押一条路线——这套词汇表会在后续每篇案例拆解里反复出现
欢迎访问 PrimeSkills —— 一个精心策划的 AI Agent 与技能市场,所有内容均经过真实企业级工作流验证。没有噱头,只有真正有效的东西。
更多实用知识和有趣产品,欢迎访问我的个人主页