AI 基建
0%
第六部分 · 编排 · 第 42 章

计算机使用:把图形界面当作动作空间

作者Changkun Ou
阅读时长约 10 分钟

第 41 章 的运行框架负责分派工具,而到目前为止,工具一直指机器接口:API、shell、数据库。世界上大多数软件没有这样的接口。它们提供的是一块为人类的眼和手而造的屏幕,而企业系统、桌面应用与供应商门户构成的长尾,永远不会提供别的。计算机使用(computer use)就是把这块屏幕当作动作空间的决定:模型接收截图,以点击坐标、敲击键盘来行动,像用户一样操作软件。本章依次讲清这个领域背了十年的设计分岔,为什么「找到按钮的位置」而不是「决定点它」才是瓶颈,给每个会话配一台在线操作系统要花多少钱,为什么屏幕是全书最严酷的提示词注入面,以及这整层接口究竟是永久的一层,还是网络长出机器接口之前的脚手架。读完本章,读者能解释一个推理头头是道的智能体为什么还是点不中提交按钮,也能给「一次工具调用」与「一次界面动作」的差价标出数量级。

永远都在的那个接口

像素路线的理由在这项技术的首次公开亮相时就说得很直白:与其为每个任务造一个工具,不如教会模型「通用的计算机技能」,让它能使用「为人设计的各种标准工具和软件程序」(Anthropic 2024)。这句话还有一个经济学读法:每一个 API 集成都要有人建、有人维护;屏幕是唯一一个集成成本已经付清的接口,由应用自己的开发者,为它的人类用户付的。

这个想法有一位工业前辈,其伤疤颇有教益。机器人流程自动化(RPA)靠脚本化的界面操作建起了一个真实的产业:机器人用选择器定位元素、回放录制好的动作序列,对付那些永远等不来 API 的软件。它公认的弱点是脆:选择器一直匹配,直到某次界面改版让它失效,业内经验把机器人的维护成本算作自动化省下的钱里可观的一块。模型驱动的计算机使用智能体,就是 RPA 的问题陈述换掉了感知层:不再是手写的选择器,而是一个像人一样找按钮的视觉语言模型,因此原则上在改版之后还能继续找到。学出来的这一层是否可靠到能兑现这个承诺,是本章的实证问题。

像素,还是控件树

屏幕的两种表示争夺着观察与动作空间,而这道分岔和这个领域一样老:2017 年开启这条研究线的环境,就已经同时暴露了两者 (Shi et al. 2017)。

像素路线给模型截图,要它输出坐标。它是普适的,画布应用、老式终端模拟器和视频帧都以同样的方式呈现,而且这恰好就是模型的视觉编码器在预训练时看世界的方式。它的失效模式是点偏:模型知道该对「什么」行动,却没点中「哪里」。结构化路线读取机器对界面的自述,浏览器里的 DOM,或操作系统的无障碍树(accessibility tree),让模型对具名元素行动,完全绕开像素运算。它的失效模式则是树自己的:自绘控件与画布渲染的界面根本不在树里,树可能落后于渲染出的状态,而一屏繁忙界面的完整转储要几千个词元,截图只要一张。介于两者之间的,是撑起这个领域早期智能体的变通办法:标记集提示(set-of-marks),在检测到的元素上叠加编号,让模型输出编号而不是坐标 (Yang et al. 2023)。自第一个真实操作系统基准以来的测量给出了经验答案:混合表示获胜,截图加控件树胜过任何单独一种 (Xie et al. 2024)。屏幕说事物长什么样,树说事物是什么;智能体两样都要。

瓶颈在视觉定位

视觉定位(grounding)是从「我想对它行动的那个东西」到屏幕坐标的一步,值得把它与规划分开,因为两者独立地失败,而让这个领域意外的是哪一个占主导。模型在自己定位不了的屏幕上规划得头头是道:那个由专业软件构建的基准,CAD 工具、科学应用、目标细小的高分辨率屏幕,测得当时最好的模型定位准确率只有 18.9%,而一个免训练的技巧,先迭代放大候选区域再预测,几乎把成绩提高到三倍 (Li et al. 2025)。卡住智能体的是感知,不是推理,这也解释了一个原本奇怪的产品细节:2026 年年中的计算机使用 API 都带缩放动作,因为专业界面在原生分辨率下的细节,低于降采样截图所能分辨的程度。

为什么单步感知错误是致命的,而不只是恼人,一行算术就够:nn 步的任务、单步成功率 pp,完成率约为 pnp^n。下面的可运行单元把它标出价来。在 30 步的任务上,单步 95% 与 99% 的差别,就是演示与产品的差别;真实的智能体还要雪上加霜,它们走的步数是熟练人类轨迹的两到四倍 (Abhyankar et al. 2025)。长程界面工作恰好按 第 90 章 的任务级可靠性分析所说的方式复利;视觉定位只是那个连乘式里由本章的硬件与感知极限所决定的那一项。

# 端到端成功率 ~= 单步成功率 ^ 步数(独立性近似)
steps = [5, 10, 30, 60, 100]
accs  = [0.90, 0.95, 0.99, 0.999]
print("步数 " + "".join(f"   p={p:<5}" for p in accs))
for n in steps:
    print(f"{n:4d} " + "".join(f"  {p**n:6.1%} " for p in accs))
import math
p = 0.99
print(f"p={p} 时成功率过半的最长任务: {math.log(0.5)/math.log(p):.0f} 步")
print("智能体走的步数还是人类最优路径的 2.7-4.3 倍,")
print("这放大的是指数,不是底数")
下层约束

视觉编码器的分辨率预算一路向上传导,塑造了整个智能体。专业显示器有数百万像素;截图进入模型前要降采样到编码器付得起的尺寸,于是一枚 12 像素的工具栏图标根本活不过这趟旅程。这一条由两层之下的编码器经济学定下的约束,解释了定位基准为何在专业软件上塌方,缩放为何成了动作空间里的一个动作,以及这个领域为何分裂成端到端像素模型与「前沿模型规划、廉价专职模型定位」的流水线两派。不是界面变难了,是传感器比屏幕便宜。

两年爬完的基准

这项能力的轨迹清晰得不寻常,因为有一个基准从头锚定着它。OSWorld 把智能体放到真实操作系统前,369 个任务、真实应用、按执行结果判分,开局就给出了定义这个问题的差距:人类高于 72%,最好的智能体 12.24% (Xie et al. 2024)。此后的攀爬读起来像这个领域方法论的压缩史。2024 年底第一个前沿模型测试版爬到二十出头,发布说明自己承认它笨拙易错 (Anthropic 2024)。几个月后,一个专门训练、配托管浏览器的模型把成绩差不多翻倍 (OpenAI 2025)。开放模型的端到端一脉,先在大规模 GUI 语料上训练、再在数百台在线虚拟机上做强化学习,一年内把自己的数字翻了一番 (Qin et al. 2025)。到 2025 年底,前沿模型越过 60%;到 2026 年年中,在基准本身修补过一次、评测框架又修订过一次之后,公布的分数落在当初人类基线的附近,而厂商自己的措辞仍然承认与熟练人类有差距。这条曲线有两种并存的读法。一种是真实而陡峭的能力增长,推理各章描述的校验器驱动训练,套到了由点击组成的轨迹上。另一种是 第 47 章 装进本书的度量警惕:尺子在半途被修订了两次,而「369 个可判分任务上达到人类基线」并不等于「智能体能顶替一个坐在办公桌前的人」。

一个会话的成本

第 41 章 里的一次工具调用是以毫秒计的无状态请求。一步计算机使用是另一种东西:截屏,把上千个图像词元连同累积的历史上传,跑一遍前沿模型的前向来规划和定位,执行动作,等界面稳定,然后再来一遍,每步数秒,每个任务数十步。智能体底下必须有一台活的、隔离的操作系统撑满整个会话;参考部署是一个容器,里面跑着虚拟显示服务器、桌面和浏览器,而一个沙箱供应商市场卖的正是这个,按虚拟机秒数计价,像上一个时代的云桌面产品。把可核实的部件拼起来,每步的图像词元、数秒的推理、虚拟机时间、比最优路径膨胀两到四倍的步数 (Abhyankar et al. 2025),一个界面任务的成本比等价的 API 调用高出两到三个数量级,这是工程估算,不是测量常数。这道差距划出了市场的格局:只管浏览器的智能体,通过调试协议驱动真实浏览器,DOM 就在手边,实例还能密集堆叠在共享硬件上,成了便宜的中间层;完整的桌面控制则留作昂贵的通用情形。沙箱及其供应商的运维细节留给 第 85 章;属于本章的是设计结论:计算机使用按轨迹计费,视觉定位的每一分改进都能收回两次成本,一次收在成功率上,一次收在省下的重试步数上。

屏幕是注入面

本书其他地方的提示词注入,经由检索到的文档或工具结果抵达。在这里它经由一切抵达,因为屏幕就是观察本身:页面文字、图片、弹窗、隐藏的表单字段,攻击者能让屏幕渲染出什么,什么就是输入。厂商文档说得毫无修饰:网页或图片里的指令可能压过操作者的指令,或诱使模型犯错 (Anthropic 2024)。演示也并非假想。安全研究者看着一个智能体浏览器用存储的支付信息在假冒店铺下单,并执行伪装成 CAPTCHA 的指令 (The Hacker News 2025);已部署的缓解手段,盯着截图的注入分类器、重大动作前的强制确认、由人亲手输入而模型永远看不到的凭证、域名白名单,是 第 57 章 那套运行时安全机制在一条无法预先过滤的通道上的特化,而 第 80 章 的支付协议就是按「这一层会漏」来设计的。对一个浏览器智能体公开发表的红队测试给出了现状的具体形状:防护把攻击成功率从约四分之一压到十分之一,把浏览器特有的攻击压到零,这样的数字支撑的是部署闸门,不是信心 (Anthropic 2025)。

争议所在

计算机使用是永久的一层还是过渡的一层,是这个领域进行中的争论,两边手里的牌都不弱。过渡派指向协议的浪潮:模型上下文协议(MCP)把工具集成商品化了,其服务器生态在 2025 到 2026 年间爆发式增长,面向智能体的界面标准也在起草,所以智能体流量聚到哪里,哪里就会建起结构化接口,而相差数量级的单任务经济账会办完剩下的事。永久派用 RPA 产业二十年的存在作答:当年撑起脚本化界面机器人的那条软件长尾,大型机前端、遗留桌面工具、没有动机开放 API 的供应商,恰恰是永远不会提供协议端点的软件,而按席位收费的 SaaS 有理由无限期地偏爱屏幕胜过 API。实验室们自己拒绝站队的方式最能说明问题:同一批公司既发协议又发像素,有结构用结构,屏幕作普适的兜底。问题不是谁赢,而是边界停在哪里;边界值得盯住,因为两边的成本以不同的速度在下降。

延伸阅读

  • Shi et al., “World of Bits: An Open-Domain Platform for Web-Based Agents” (起点:像素、DOM、鼠标键盘构成的强化学习环境), 2017. proceedings.mlr.press
    GUI 智能体研究线的起点:智能体感知像素与 DOM、用鼠标键盘行动,并附带此后多年供整个领域训练用的 MiniWoB 任务集。
  • Deng et al., “Mind2Web: Towards a Generalist Agent for the Web” (把「泛化到没见过的网站」立为标尺), 2023. arXiv:2306.06070
    跨 137 个真实网站的两千多个开放式任务,把「能否泛化到没见过的网站」立为衡量网页智能体的标尺。
  • Zhou et al., “WebArena: A Realistic Web Environment for Building Autonomous Agents” (对人与智能体差距的第一次大规模测量), 2023. arXiv:2307.13854
    自托管的真实网页任务(电商、论坛、代码托管),最好的 GPT-4 智能体端到端完成率 14.41
  • Yang et al., “Set-of-Mark Prompting Unleashes Extraordinary Visual Grounding in GPT-4V” (给元素编号,让模型选号), 2023. arXiv:2310.11441
    在检测到的屏幕区域上叠加编号标记,让模型输出编号而不是坐标;在原生定位模型出现之前,这个变通办法支撑了 GUI 视觉定位。
  • Hong et al., “CogAgent: A Visual Language Model for GUI Agents” (第一个围绕微小界面元素设计的开放模型), 2023. arXiv:2312.08914
    一个 180 亿参数、专为 GUI 设计的开放视觉语言模型,因界面元素细小而配备高低分辨率双编码器:证明 GUI 感知需要架构层面的功夫,而不只是提示词。
  • Xie et al., “OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments” (成为整个领域进度条的真实操作系统基准), 2024. arXiv:2404.07972
    真实操作系统上的 369 个任务,以执行结果判分:人类高于 72
  • Anthropic, “Introducing computer use, a new Claude 3.5 Sonnet, and Claude 3.5 Haiku” (第一个前沿模型的计算机使用测试版,连同它的免责声明), 2024. anthropic.com
    第一个公测「计算机使用」的前沿模型:以通用计算机技能取代按任务定制的工具,发布时坦率注明它是实验性的、笨拙且容易出错。
  • OpenAI, “Introducing Operator” (托管浏览器里专门训练的计算机使用智能体), 2025. openai.com
    计算机使用智能体(CUA):输入截图、输出鼠标键盘动作,跑在托管的远程浏览器里,在基准发布一年内把 OSWorld 最好成绩提高到近三倍。
  • Qin et al., “UI-TARS: Pioneering Automated GUI Interaction with Native Agents” (端到端的开放对照组), 2025. arXiv:2501.12326
    端到端训练的原生 GUI 智能体:输入截图、输出拟人动作,不套任何商业模型,并通过数百台在线虚拟机上的强化学习持续打磨。
  • Gou et al., “Navigating the Digital World as Humans Do: Universal Visual Grounding for GUI Agents” (模块化的对案:前沿模型规划,专职模型定位), 2024. arXiv:2410.05243
    流水线路线的宣言:前沿模型用语言规划,专职定位模型把描述解析成坐标,并主张智能体应当像人一样只感知像素。
  • Li et al., “ScreenSpot-Pro: GUI Grounding for Professional High-Resolution Computer Use” (瓶颈在感知,不在规划), 2025. arXiv:2504.07981
    在 4K 专业软件上做视觉定位:当时最好的模型只找到 18.9
  • Abhyankar et al., “OSWorld-Human: Benchmarking the Efficiency of Computer-Use Agents” (成功率遮住了真正的产品问题), 2025. arXiv:2506.16042
    测量成功率遮住的东西:每个任务耗时数十分钟,步数是人类最优轨迹的 2.7 至 4.3 倍,而延迟由模型调用而非动作本身主导。
  • Anthropic, “Piloting Claude for Chrome” (一组只够支撑闸门、撑不起信心的红队数字), 2025. anthropic.com
    附带公开红队结果试点的浏览器智能体:防护把提示词注入的攻击成功率从约四分之一降到十分之一,厂商自己的定性是仍不足以大范围部署。
  • The Hacker News, “Experts Find AI Browsers Can Be Tricked by PromptFix Exploit” (对抗性网络,不再是假设而是演示), 2025. thehackernews.com
    对 Guardio Labs「Scamlexity」研究的报道:智能体浏览器在假店铺下单、执行伪装成 CAPTCHA 的隐藏指令,自主花掉了存储的支付信息。

评论

登录后评论