Skip to content

OS-BLIND:良性用户指令下的 Computer Use Agent 风险 ​

摘要 ​

OS-BLIND 研究用户指令本身看似正常、风险却嵌在桌面/网页环境或 Agent 自动拆分的子任务中的 Computer Use 失效。作者构造 300 个经专家审阅的任务,报告多数受测 CUA 的攻击成功率超过 90%,Claude 4.5 Sonnet 在该基准上为 73.0%;将任务显式写成有害请求反而会降低成功率。结果仅覆盖模拟环境和论文定义的有害终态,不代表真实用户请求的发生率。

核心创新与差异 ​

它不要求不可信网页直接说出恶意命令,而是检查 Agent 是否会在“帮我完成正常工作”的目标下忽略环境含义、对象影响与动作后果。这与视觉提示词注入不同:首个失效控制是执行前没有把自然语言目标、环境状态和高影响终态做一致性核验。

威胁模型与攻击链 ​

用户目标可为良性;风险来自环境嵌入的内容、预置状态或任务分解形成的间接副作用。Agent 在邮件、代码、媒体或系统界面中读取线索并执行高影响操作,却未识别其最终影响。

攻击工件与复现材料 ​

原基准包含模拟的数据外传、系统破坏和代码注入场景。本站不复制具体任务文本、命令或界面路径;下列为安全测试状态机:

text
用户目标 → 候选动作 → 影响分类
若动作影响账户、外部传输、代码执行或系统状态:暂停 → 显示对象与副作用 → 要求可信确认

测试夹具应使用 .invalid 域名、临时文件与不可达服务,避免把基准转化为真实操作脚本。

实验设计与实际过程 ​

作者在 OSWorld 风格桌面环境、模拟 Gmail/VLC/VS Code 等界面上,测量尝试率与攻击成功率,并以人工复核校准自动 Judge。研究还比较显式有害提示、任务分解粒度与多 Agent 编排的影响;本站未复现。

关键结果与实际影响 ​

作者报告环境嵌入风险通常高于 Agent 主动造成风险,若干防护只能部分降低成功率;MirrorGuard 在其设置中下降幅度较大但仍非零。部署者不能把“用户原话无害”当作动作安全证据,应对终态、对象和权限做独立检查。

防护措施与验证方法 ​

为高影响动作建立动作级风险分类与浏览器/桌面外可信确认;绑定对象、域名、文件来源和实际请求;记录任务分解链;以良性目标加风险环境的组合测试验证防护,而非只测试显式恶意 Prompt。

局限与待验证问题 ​

环境和任务由研究者构造,部分高风险终态可能受模拟条件影响。不同 OS、真实账户策略、模型版本和人工确认设计会改变结果,仍需独立复现。

参考链接 ​