计算机使用:把图形界面当作动作空间
计算机使用让智能体能够操作那些缺少适合当前工作的机器接口的软件。它可以使用供应商门户、桌面应用,或者只有人类界面才提供有效控件的画布。这种覆盖能力很有价值,却是间接的:屏幕是一项观察,指针和键盘事件是动作。无论按钮清晰可见,还是浏览器已经登录,都不能告诉运行框架,用户是否授权了按钮背后的实际影响。
因此,实用原则应该很明确:如果 API、命令或语义化界面操作能够表达预期效果及其授权,就优先使用带类型的工具。只有在结构缺失、不完整或不可靠时,才使用计算机视觉和坐标。计算机使用是面向渲染软件的通用后备方案,不是机器接口的通用替代品。一个系统可以在同一任务中切换表示方式,但每条通道都必须写入 第 41 章 所述的同一份运行与外部影响账本。
本章把这套后备方案写成一个部分可观测的控制循环。它将观察、定位、执行和验证分开,定义模型与执行器之间的契约,解释重试为何会复制真实影响,并说明如何评估整个系统,而不是把定位分数与工作成功混为一谈。
从脚本界面到学习控制
屏幕驱动的自动化早于如今的多模态模型。2017 年的 World of Bits 同时通过像素和 DOM 暴露网页,并提供鼠标和键盘动作 (Shi et al. 2017)。传统浏览器自动化和机器人流程自动化依靠选择器、无障碍属性或录制坐标。学习式计算机使用系统在此基础上增加一个策略,让模型能够理解陌生布局,并根据视觉或结构化观察提出动作。Anthropic 在 2024 年推出的公开测试版,把这种模式带进了前沿模型产品:截图进入模型,开发者提供的工具执行模型请求的鼠标和键盘动作 (Anthropic 2024)。
界面变化不会因为学习式定位而消失。视觉策略可能不受 DOM 路径变化影响,却在主题、缩放比例、图标或布局改变后失败。语义定位器可能挺过外观改版,却因为自定义控件缺少无障碍名称而失效。两者面对的变化不同,失败方式也不同。真正有用的问题不是像素或选择器谁天生更稳,而是哪一种观察和动作通道,能为当前操作提供足够稳定的身份。
部分可观测的控制循环
设 是第 步隐藏的应用状态。它不只包括当前页面,还包括活动账户、选中记录、打开的对话框、尚未保存的修改、远程服务状态、焦点、剪贴板、下载内容,以及当前视口以外的窗口。执行器返回一个部分观察:
其中, 是观察过程, 是截取元数据,例如窗口、视口、分辨率、缩放比例、光标、时间戳和所选模态。观察可以包含截图、DOM 或无障碍树的子集、检测到的元素、当前网址和焦点元数据。它是关于 的证据,不是状态本身。
给定历史 、用户指令 和剩余预算 ,策略给出下一项动作的概率分布:
这里的 是策略,这个表达式表示它在给定历史、指令和预算时,对下一项动作 给出的概率分布。执行器负责验证并分发选中的动作。随后,环境按下式变化:
其中, 是状态转换过程, 汇集智能体无法控制的影响,例如网络延迟、动画、弹窗、另一位行为者或远程故障。只有独立验证器在步骤、时间或成本上限之前确认所需后置条件 ,任务才算成功。每个符号都对应实现必须记录或限制的组件,没有任何符号假设模型能够看到隐藏的应用状态。
这个形式化描述很重要,因为部分观察可能看起来合理,实际上却是错的。截图可能漏掉当前窗口后方的对话框;控件树可能已经过时;浏览器可能在远程点击成功后立刻崩溃。模型声称任务完成,也只是一项提议,不是证明。
因此,每一步交互都应该明确记录:
- 截取观察,并记录观察身份、时间戳、坐标系、窗口、焦点和所选模态。
- 让模型提出一个动作,或一小批有明确上限的动作。
- 解析语义意图、目标来源、账户、资源、载荷和预期影响。
- 在模型之外检查授权、审批、新鲜度、焦点、坐标边界和可操作性。
- 使用动作 ID 和截止时间分发动作。
- 等待可观察条件,而不是任意休眠;每次改变状态后都重新截取观察。
- 返回执行器证据并验证预期后置条件,明确区分
executed、rejected、timed_out和outcome_unknown。
可以用三种刻意保持简单的记录来表示这条边界:
UIObservation {
frame_id,
captured_at,
window_id,
viewport,
focus,
screenshot_ref,
semantic_elements,
visible_dialogs
}
UIAction {
action_id,
frame_id,
window_id,
viewport,
kind,
target,
payload_ref,
precondition,
postcondition,
risk_class,
approval_id,
timeout
}
UIResult {
action_id,
status,
dispatched_at,
completed_at,
new_frame_id,
observed_effect,
remote_receipt,
error
}
执行器应该拒绝陈旧帧、无效或越界的坐标、焦点不匹配、已经过期的审批,以及身份已经改变的目标。如果推理前缩小了图像,坐标映射必须使用记录下来的变换,在两个方向上保持一致。现有厂商指南也明确提醒,坐标指向原始截图分辨率 (OpenAI 2026)。执行有重大影响的点击前,要重新截取并验证活动窗口、来源、目标和准确载荷。批量动作必须停在每一道副作用边界。
像素、结构、标记与工具
图形界面系统不只有两种表示。每种表示揭示不同状态,也提供不同的目标身份。
截图像素。 它保留视觉布局、自定义绘图、图标、空间关系和画布内容。它不擅长处理微小或被遮挡的目标、缩放误差、缺少稳定元素身份,以及不可见或屏外状态。
DOM 或无障碍树。 它提供名称、角色、取值、层级,有时还能直接对节点执行动作。但它可能漏掉自定义控件,也可能包含隐藏或屏外的攻击文本;节点可能过时,转储可能过于嘈杂,视觉位置也可能不明确。
检测元素或标记集。 它把界面区域映射为当前帧内的稳定标签,成为视觉与语义之间的紧凑桥梁 (Yang et al. 2023)。它会继承检测器漏检、标签重复、覆盖层挡住内容,以及元素移动后标签失效等问题。
API 或带类型的工具。 这条通道提供明确参数、校验、返回值,通常还支持幂等或审计。它的限制在于覆盖不足、集成成本、模式漂移,以及接口没有暴露的操作。
覆盖范围和身份是两回事。像素拥有广泛的视觉覆盖,却缺少可靠身份;控件树可以叫出元素名称,却未必显示它正被对话框盖住;带类型的操作可以精确识别资源,却可能无法表达任务需要的视觉判断。结构化观察同样是不可信内容:过时的无障碍树或攻击者控制的标签,不会因为机器可读就更安全。
应该选择最能准确表达这项操作的通道。如果信息只存在渲染结果中,就用视觉读取图表;如果语义元素的角色和身份仍然有效,就直接操作它;如果支付或删除 API 能提供精确资源、授权、幂等和回执,就调用 API。混合策略必须在相同模型、任务和运行框架下,与纯像素方案和纯结构方案比较。OSWorld 最初的消融实验并没有证明某一种表示在所有场景下都最好 (Xie et al. 2024)。
定位、执行与验证
“点击保存按钮”至少包含五个彼此独立的问题:
- 意图与规划: 判断保存是不是下一项有用操作。
- 目标识别: 从相似控件中找出当前文档的保存动作。
- 定位: 把目标映射到当前观察中的坐标、节点或语义句柄。
- 执行: 把事件发送给正确的窗口和控件。
- 结果验证: 确认正确文档已经保存,而不只是按钮外观发生了变化。
ScreenSpot-Pro 单独测试第三项。它在多个操作系统的高分辨率专业应用中,评估预测点是否落在目标内。在此前参与测试的模型中,最佳单模型成绩为 18.9%,级联式视觉搜索达到 48.1% (Li et al. 2025)。这说明该场景中的定位难度很高,却不能证明定位主导端到端任务中的规划、操作知识、恢复或验证问题。
小目标会暴露两种独立的工程故障。降采样会抹掉细节;缩放时没有保持一致变换,则会让所有坐标偏移。放大、裁剪和高分辨率分块可以缓解前一个问题,显式坐标系解决后一个问题。现有计算机使用模式因此提供放大动作,但放大会改变观察,也会让旧帧坐标失效 (Anthropic 2026)。
下层系统会塑造智能体看起来有多聪明。截取分辨率决定模型能看到什么;视口和裁剪策略决定省略什么;传输与模型延迟会让观察变旧;沙箱决定哪些窗口、文件、剪贴板内容和网络目标存在。因此,定位失败可能来自传感器或执行器,而不是策略本身。把错误归因于推理之前,先记录这些下层条件。
可靠性意味着抵达经过验证的状态
对于一条固定路径中的 个必要步骤,设 表示第 步实现了它的后置条件。定义条件步骤概率:
其中, 表示 之前所有必要步骤的结果。根据概率链式法则:
常见的 只是齐次且独立的特殊情况,也就是每个条件概率都等于 ,而且任何失败都无法恢复。图形界面错误彼此相关:选错一个窗口可能污染后续多个动作;页面缓慢会引发一连串陈旧点击;恢复动作会同时改变剩余步骤和未来概率。对于交互式策略,真正有用的指标,是它能否在资源上限之前抵达经过验证的目标状态,其中也要计算恢复行为。
OSWorld-Human 把完成率之外的效率问题显现出来。在它评估的系统中,模型调用占据了大部分延迟,后期步骤可能远慢于早期步骤,表现最好的智能体也使用了人工参考轨迹所需步骤的 2.7 至 4.3 倍 (Abhyankar et al. 2026)。这些是特定智能体和任务的测量结果,不是通用倍数。它们说明,任务成功率本身会掩盖运营质量。
重试必须理解外部影响。读取、放大或重新截图通常可以安全重试;发送、购买、删除、修改权限或提交表单则未必如此。如果远程操作已经生效,下一次观察前却发生超时,盲目重放可能造成重复操作。只有操作本身幂等,或权威当前状态证明它尚未发生,变更才可以安全重试。否则,应通过回执、应用历史或远程状态查询并核对。如果结果仍然不明确,就进入 needs_reconciliation,不能再次点击。
审批遵循同一规则。不可逆操作的审批必须绑定准确载荷、目标、来源、账户、价格或披露数据,以及当前状态。审批只能使用一次,也会过期。屏幕或载荷变化后必须重新审批;广义目标的审批不等于每次点击都获准。停止或恢复本地环境,也无法撤销远程服务已经提交的操作。
环境也是系统的一部分
不是每项任务都需要完整桌面。网页工作流使用浏览器环境即可;任务跨越原生应用、系统对话框或本地文件时,才需要完整桌面。无论选择哪种边界,环境都拥有模型看不到的状态:浏览器画像和 Cookie、下载、剪贴板、文件、通知、多个窗口、弹窗、扩展、地区设置、缩放比例和身份验证挑战。
三类状态必须分开:
- 应用状态是用户任务改变的本地与远程状态。
- 会话状态包括浏览器或桌面画像、凭据、文件、剪贴板、网络身份和环境配置。
- 模型上下文是提供给策略的有损历史。
恢复模型上下文不会恢复应用状态;恢复虚拟机快照不会逆转远程应用状态;重用会话状态,则可能把一次运行的数据或权限泄漏给另一次运行。
计算机使用应该在全新、隔离的浏览器上下文或桌面环境中运行,只提供必要的账户和网络访问 (OpenAI 2026; Anthropic 2026)。不要把智能体接入包含个人历史、扩展、已保存银行卡或密码管理器的宿主浏览器画像。除非任务明确需要,否则关闭共享宿主挂载和剪贴板桥接。浏览器控制、远程调试和显示端点必须保持私有、经过身份验证,并且只属于一个会话。下载内容进入隔离区,不能自动打开或执行;上传与分享要经过和其他数据传输相同的防泄漏与审批检查。
隔离也有多个层次。全新浏览器画像负责隔离会话数据;浏览器沙箱和站点隔离负责限制恶意渲染器;加固容器或微型虚拟机负责保护宿主;网络和账户策略负责限制远程影响。彼此不能替代,而且普通容器并不拥有独立的操作系统内核 (Souppaya et al. 2017; Chromium Project 2026)。
界面同时是注入面和隐私面
像素、OCR、页面文字、DOM 节点、无障碍标签、邮件、PDF、下载内容和工具结果,都是不可信数据,不是权限。它们可以描述智能体应该做什么,但只有用户的直接指令和外部策略,才能授权新目标、新数据流或新的副作用 (OpenAI 2026)。已经登录的浏览器通过 Cookie 携带环境权限。如果页面内容能让智能体从一个来源读取数据,再把它输入另一个来源,智能体就会成为困惑代理,跨越普通浏览器代码无法跨越的边界。
因此,每一项外部影响都必须在模型之外完成授权。系统要解析已经验证的用户和租户、当前来源和账户、目标资源、语义动作、准确参数、将要披露的数据、剩余预算和必要审批。允许访问的域名并不代表其中内容可信:它可以承载用户文字、第三方框架、重定向、恶意广告或已经失陷的页面。导航策略必须重新核对协议、主机、端口、解析后的目标、重定向,以及对本地网络、私有网络和元数据网络的访问。
提示词注入检测器可以降低暴露,却不能代替授权。分类器不是授权机制。即使它漏掉攻击,策略层仍然必须阻止未经授权的发送、发布、购买、删除、安装、权限变更、接受法律条款和敏感数据披露。WASP 的端到端评估发现,现实且成本很低的注入就能转移有能力的网页智能体 (Evtimov et al. 2025)。攻击成功、攻击取得部分进展和发生高权限影响,应当作为不同结果报告。攻击没有完成,可能只是因为系统能力不足,并不代表控制可靠。
隐私保护始于模型推理之前。截图或结构化树可能包含姓名、账户标识、通知、输入值、浏览历史、一次性验证码,以及任务范围之外的数据。只截取最小相关窗口或视口;条件允许时,在上传前遮蔽敏感区域;默认不要记录原始截图。必要制品应按会话加密,限制访问,并短期保留。用户通过可信方式接管时,要同时暂停截图采集和模型动作。
输入敏感数据也属于传输 (OpenAI 2026)。由人亲自输入也不能保证保密,因为下一张截图、DOM 值、自动填充弹窗或账户页面都可能再次显示它。应优先使用有范围的凭据代理或动作代理。如果用户必须输入密码或一次性验证码,就通过智能体之外的可信界面移交控制,暂停采集和模型动作,清除临时界面,再以更低权限恢复。模型不应收到可重复使用的凭据。
在风险发生点设置审批,也就是紧靠提交动作之前。向用户展示准确站点和账户、接收方或目标、载荷、披露数据、金额和不可逆影响。把审批绑定到不可变动作 ID 或载荷哈希,审批后重新验证最新屏幕和来源;任何内容变化都必须重新审批。屏幕上的文字永远不能自行批准操作。
一条轨迹的成本
计算机使用消耗的是一条轨迹,不是一次模型调用。可以用下面的恒等式记账:
其中, 表示整条轨迹的总成本, 表示第 步的成本:
关键路径延迟为:
这里, 是包括恢复步骤在内的尝试次数; 是推理成本; 是图像处理或图像词元成本; 是浏览器、容器或虚拟机运行时间; 包括截取、分发、存储和验证成本。 是第 步在截取、传输、推理、分发、等待稳定和验证过程中的非重叠挂钟时间。每一项都应实际测量,不能从某个通用的图形界面对 API 倍数推断。
批处理可以减少模型调用,却会消耗新鲜度:后面的动作在看不到中间状态时就已经决定。只有资源和外部影响彼此独立,动作才适合并行。报告任务成功率时,还要同时报告动作数、模型调用、词元、挂钟时间、尾延迟、虚拟机秒数、重试和人工介入。全部尝试的成本和成功条件下的成本都要报告,后者单独出现会掩盖昂贵失败。
评估实际运行的整个系统
定位基准询问模型能否在给定图像中找到正确目标;端到端任务基准询问模型、运行框架、执行器、环境和验证器能否抵达所需状态。ScreenSpot-Pro 测量前者。OSWorld 在桌面应用中测量后者:最初的 369 项任务中,人类完成率为 72.36%,当时参与测试的最佳智能体为 12.24% (Xie et al. 2024)。AndroidWorld 又提供了 20 个移动应用中的 116 项参数化任务,并用程序完成设置、成功检查和清理;其初始结果也表明,任务变体会显著改变表现 (Rawles et al. 2025)。
这些数字不是同一条不随时间变化的曲线。基准任务、环境镜像、应用版本、观察和动作接口、最大步骤数、提示词、重试和验证器都会变化。原始 OSWorld 与 OSWorld-Verified 的结果不能直接比较,后来智能体在修订版基准上的得分,也不能用来声称超过原始人类基线。OSWorld 2.0 又有意改变了问题:它的 108 条工作流更长,并暴露约束、变化信息、隐藏状态、向用户提问和验证方面的故障 (Yuan et al. 2026)。基准版本和运行框架都是每个分数的一部分。
应使用基于状态的验证器,读取权威应用或服务状态。最终截图和模型自述都只是薄弱证据。每次运行都要记录任务及初始状态、基准提交、环境镜像、应用版本、分辨率、缩放比例、地区设置、账户、网络条件、观察来源、动作接口、模型快照、提示词、运行框架和验证器版本、限制、重试和排除项。完成率要附带自助法置信区间;样本量允许时,还要按应用、任务长度和风险分层。
发布评估应覆盖能力、效率、恢复和安全四类证据:
- 能力: 任务完成率、定位准确率、无效动作率、陈旧或越界动作、不必要步骤和模型调用。
- 效率: 挂钟时间、尾延迟、词元、成本、虚拟机秒数、重试和人工介入。
- 恢复: 延迟渲染、移动或遮挡目标、弹窗、焦点被夺走、陈旧无障碍树、网络重试、身份验证挑战、崩溃,以及结果不明的重复动作之后的恢复成功率。
- 安全: 副作用精确率、审批绕过率、提示词注入攻击成功率、敏感数据暴露、取消后动作数、未授权来源尝试,以及超时后仍然提交的外部影响。
这些故障必须主动注入。改变分辨率、缩放比例、主题、地区设置和窗口大小;插入动画、延迟加载、覆盖层、重复控件、焦点变化和陈旧结构;在点击之后、观察结果之前让系统崩溃;把指令注入可见内容和结构化标签。只通过干净路径的系统,还没有证明自己能够可靠地使用计算机。
部署核对表
开放图形界面动作空间之前,确认以下条件成立:
- 首先考虑带类型或语义的替代方案;
- 每项观察都有帧、窗口、视口、缩放比例、焦点和时间戳;
- 坐标和语义句柄都根据最新状态核对;
- 每项变更都声明前置条件、后置条件、风险类别和重试策略;
- 审批绑定准确目标、载荷、账户和当前状态;
- 结果不明确时进入核对状态,而不是盲目重放;
- 浏览器或桌面与宿主画像、凭据、文件和控制端点隔离;
- 截图采集、日志、剪贴板、下载、上传和保留都有明确的隐私规则;
- 独立验证器检查当前状态;
- 评估报告完整的模型、运行框架和环境配置。
计算机使用可能成为长期存在的兼容层,也可能随着更多产品提供面向智能体的工具而缩小范围。两种结果都不需要一条放之四海皆准的断言。如果结构化操作能提供稳定身份、精确授权、更低延迟和可审计结果,它就更有吸引力。视觉控制仍然适合遗留软件、自定义渲染、跨应用工作流,以及内容本身就是视觉信息的任务。这条边界必须通过具体操作和实证决定:让每项外部影响走最安全且能够表达该操作的接口,再在真实界面漂移和故障下测量后备方案。
单个智能体已经要面对部分观察、陈旧状态和模糊影响,增加智能体并不会消除这些问题。如果多项策略共享浏览器或桌面,它们可能争抢焦点、使彼此的帧失效,并重复产生副作用,除非系统明确规定所有权和协调方式。下一章 第 43 章 将继续讨论这个协调问题。
延伸阅读
- Shi et al., “World of Bits: An Open-Domain Platform for Web-Based Agents” (起点:像素、DOM、鼠标键盘构成的强化学习环境), 2017. proceedings.mlr.pressGUI 智能体研究线的起点:智能体感知像素与 DOM、用鼠标键盘行动,并附带此后多年供整个领域训练用的 MiniWoB 任务集。
- Deng et al., “Mind2Web: Towards a Generalist Agent for the Web” (把「泛化到没见过的网站」立为标尺), 2023. arXiv:2306.06070跨 137 个真实网站的两千多个开放式任务,把「能否泛化到没见过的网站」立为衡量网页智能体的标尺。
- Zhou et al., “WebArena: A Realistic Web Environment for Building Autonomous Agents” (对人与智能体差距的第一次大规模测量), 2023. arXiv:2307.13854自托管的真实网页任务(电商、论坛、代码托管),最好的 GPT-4 智能体端到端完成率 14.41%,人类为 78.24%,第一次把差距量化出来。
- Yang et al., “Set-of-Mark Prompting Unleashes Extraordinary Visual Grounding in GPT-4V” (给元素编号,让模型选号), 2023. arXiv:2310.11441在检测到的屏幕区域上叠加编号标记,让模型输出编号而不是坐标;在原生定位模型出现之前,这个变通办法支撑了 GUI 视觉定位。
- Hong et al., “CogAgent: A Visual Language Model for GUI Agents” (第一个围绕微小界面元素设计的开放模型), 2023. arXiv:2312.08914一个 180 亿参数、专为 GUI 设计的开放视觉语言模型,因界面元素细小而配备高低分辨率双编码器:证明 GUI 感知需要架构层面的功夫,而不只是提示词。
- Xie et al., “OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments” (成为整个领域进度条的真实操作系统基准), 2024. arXiv:2404.07972OSWorld 为网页、文件、命令行与应用工作流任务定义明确的初始状态,并用定制的执行式评估器检查结果。
- Anthropic, “Introducing computer use, a new Claude 3.5 Sonnet, and Claude 3.5 Haiku” (第一个前沿模型的计算机使用测试版,连同它的免责声明), 2024. anthropic.com第一个公测「计算机使用」的前沿模型:以通用计算机技能取代按任务定制的工具,发布时坦率注明它是实验性的、笨拙且容易出错。
- OpenAI, “Introducing Operator” (托管浏览器里专门训练的计算机使用智能体), 2025. openai.com计算机使用智能体(CUA):输入截图、输出鼠标键盘动作,通过托管的远程浏览器部署,并在敏感步骤让用户接管。
- Qin et al., “UI-TARS: Pioneering Automated GUI Interaction with Native Agents” (端到端的开放对照组), 2025. arXiv:2501.12326端到端训练的原生 GUI 智能体:输入截图、输出拟人动作,不套任何商业模型,并通过数百台在线虚拟机上的强化学习持续打磨。
- Gou et al., “Navigating the Digital World as Humans Do: Universal Visual Grounding for GUI Agents” (模块化的对案:前沿模型规划,专职模型定位), 2024. arXiv:2410.05243流水线路线的宣言:前沿模型用语言规划,专职定位模型把描述解析成坐标,并主张智能体应当像人一样只感知像素。
- Li et al., “ScreenSpot-Pro: GUI Grounding for Professional High-Resolution Computer Use” (针对专业界面视觉定位的专项测试), 2025. arXiv:2504.07981面向高分辨率专业软件的点目标定位基准:此前最佳模型达到 18.9%,级联视觉搜索达到 48.1%。它隔离测试定位能力,而不是端到端任务完成。
- Abhyankar et al., “OSWorld-Human: Benchmarking the Efficiency of Computer-Use Agents” (成功率遮住了真正的产品问题), 2026. arXiv:2506.16042测量完成率遮住的东西:受测智能体的步数是人工参考轨迹的 2.7 至 4.3 倍,且延迟主要来自模型调用。
- OpenAI, “Computer use” (当前的执行器、安全与审批指南), 2026. developers.openai.com这份官方指南介绍了截图与动作循环、原始分辨率坐标、隔离执行、不可信内容、敏感数据传输,以及风险动作的即时审批。
- Anthropic, “Computer use tool” (工具模式、参考循环与当前安全指南), 2026. platform.claude.com计算机使用动作、开发者执行循环、缩放支持、隔离环境、最小权限、域名限制与人工确认的官方文档。
- Rawles et al., “AndroidWorld: A Dynamic Benchmarking Environment for Autonomous Agents” (带程序化状态检查的参数化移动端任务), 2025. proceedings.iclr.cc可复现的 Android 环境,覆盖 20 个应用的 116 个参数化任务,每项都有初始化、基于状态的成功检查和清理;任务变化会显著影响结果。
- Evtimov et al., “WASP: Benchmarking Web Agent Security Against Prompt Injection Attacks” (网页智能体的端到端提示词注入评测), 2025. proceedings.neurips.cc端到端基准,显示现实而低成本的提示词注入能够使网页智能体偏航,并区分攻击者部分得逞与完整成功。
- Yuan et al., “OSWorld 2.0: Benchmarking Computer Use Agents on Long-Horizon Real-World Tasks” (长时程工作流揭示隐藏状态与验证失败), 2026. arXiv:2606.29537包含 108 个长时程工作流的基准,揭示变化信息、隐藏状态、约束、向用户提问和验证方面的失败,而不只测试基础 GUI 操作。
- Souppaya et al., “Application Container Security Guide” (容器需要主机、镜像、运行时与编排控制), 2017. csrc.nist.govNIST 指南区分容器镜像、仓库、编排器、运行时和宿主操作系统,并为每一层风险给出控制措施。
- Chromium Project, “Site Isolation” (渲染器隔离只是浏览器安全的一层,并非宿主隔离), 2026. chromium.orgChromium 对站点隔离的说明:把跨站文档放进不同进程以限制被攻陷的渲染器,但不能替代环境隔离。
- Anthropic, “Piloting Claude for Chrome” (一组只够支撑闸门、撑不起信心的红队数字), 2025. anthropic.com附带公开红队结果试点的浏览器智能体:防护把提示词注入的攻击成功率从约四分之一降到十分之一,厂商自己的定性是仍不足以大范围部署。
评论
登录后评论