Skip to content

浏览器与 Computer Use Agent 安全研究综述 ​

摘要 ​

Computer Use Agent 同时解释像素、DOM、无障碍树和用户目标,并通过点击、键盘与浏览器状态产生真实副作用。网页中的文字、图像和 UI 都可能成为指令载体;视觉相似不等于来源可信,截图中看到的确认也不等于后端动作参数正确。

分类介绍 ​

本领域覆盖浏览器和桌面操作 Agent 的视觉注入、DOM 操纵、界面欺骗、点击劫持与高风险确认。通用浏览器引擎漏洞不作为 AI 专项;第三方内容注入可关联 A5.1,但依赖界面感知和操作语义的主根因归本类。

主要安全风险 ​

  • 页面可用隐藏文字、视觉覆盖、滚动外内容和动态 DOM 影响 Agent 判断。
  • 按钮标签、目标域名和真实提交参数可能不一致。
  • 登录态、自动填充和浏览器扩展把网页输入连接到高价值凭据。
  • CAPTCHA、同意、支付和发送操作在自动化下失去人类确认语义。
  • 移动截图中的正常通知图标也可能成为后门模型的动作触发器;此时界面内容本身无恶意文本,首个失效控制是上游模型制品完整性。
  • 安全加固是领域条件化的:一项覆盖 793 个浏览器 episode 的基准 测得 Claude Sonnet 4.6 与 GPT-5.4 在 140 个有害浏览器模板上的攻击成功率为 0/140,而同权重模型在编码域基准上最高可达 100%——浏览器域的注入抗性不能代表编码域,结论也只覆盖手工模板、不含优化后的对抗字符串,不能替代针对优化注入的红队测试。

防护措施与验证方法 ​

隔离浏览器配置和站点数据;将网页内容视为不可信;高风险动作使用浏览器外的可信确认界面,显示规范化域名、对象、金额和权限;限制下载、扩展、剪贴板和本地文件访问;记录截图、DOM 摘要与实际网络请求用于复核。

局限与待验证问题 ​

  • 如何检测只对视觉模型可见、对人类不显著的指令?
  • 可信确认界面如何抵抗网页仿冒和 Agent 自行点击?
  • DOM、像素和网络请求三种视图不一致时应信任哪一层?

历史研究成果 ​

本分类的独立研究分别检查操作时序与环境语义。GUI Agent 的 TOCTOU 与跨应用动作重绑定研究画面已被理解但动作尚未派发时的窗口、覆盖层、DOM 和 Android 前台应用状态;桌面实验说明执行前复核需同时绑定视觉、窗口身份和页面/请求语义,Android 实验则进一步证明零危险权限应用可借高权限 GUI Agent 跨应用执行敏感操作,且 Agent 的任务恢复逻辑可能把单步竞争串成多步链。OS-BLIND则以表面良性的用户目标与风险环境组合,测量 Agent 是否会因未核验终态而执行高影响动作。前者的修复尚不能覆盖无可见 DOM 竞争和所有跨应用状态,后者在其 300 个模拟任务中报告较高 ASR;两者共同说明“用户原话无害”“应用没有危险权限”与“画面看似正常”都不能替代动作对象、后果和可信确认的验证,结论限于各自环境和模型。

ActReal从执行真实性补充了另一类移动端风险:当系统级 Agent 同时控制输入派发和应用可见传感器交付时,触控轨迹与 IMU 的物理耦合不再是两个独立证据。作者在五类动作、三种观测模态、六个检测器、三个 Agent 框架和两款 Android 手机上报告平均事件级 ASR 77.5%,联合触控—IMU 条件仍为 71.1%。该结论依赖高权限执行器,并不覆盖高保障应用的硬件证明与服务端风控;它与 TOCTOU 研究共同说明,Computer Use 防护必须核验观测来源和动作后果,而不能只增加模型可见信号。

两项新基准进一步把“界面可操作”与“动作可信”拆开。ADeptS-Bench以跨设备双流任务同时测量能力与安全:七个模型中,没有模型能稳定同时达到任务成功率高于 80% 且攻击成功率低于 30%;所有模型都曾点击 2.5 万美元订单的 Checkout,也都没有识别被错误标成 Optimize 的恢复出厂按钮。移除拒绝工具后,不同模型族的 ASR 增幅从约 10–11 个百分点到 21–23 个百分点不等,说明“有无拒绝工具”会改变结果,却不能替代对对象、金额和真实动作语义的校验。AnTrap则把 Android 运行时异常分成 State、Thinking、Action、Round 四层十类,在 16 个模型上区分可由对抗训练改善的异常与仍受推理瓶颈限制的异常。两者均是作者基准、尚无独立复现;设备、应用、异常注入和工具配置限制了外推,不能把单一成功率解释为真实移动设备的事故概率。

相关研究文章 ​

参考链接 ​