外观
MIRAGE:移动 GUI Agent 的用户内容提示词注入
摘要
MIRAGE 关注视觉语言模型驱动的移动 GUI Agent:它们从截图读取像素后决定操作,通常无法从视觉外观上可靠区分系统 UI 与聊天、评论或描述等用户生成内容。作者以 Localizer、Generator、Curator 三段式流水线,在正常应用截图的用户可控区域渲染上下文相关文本,构造视觉上接近原界面的注入样本。
作者在 10 个应用、11 类攻击意图、1,111 个样本上评测五个 VLM Agent,报告各模型攻击成功率为 23%–30%;人类真实感评分为 3.02/5,高于文中最强对照的 2.52。实验只覆盖单截图、单步动作及五个 API 模型,不能代表原生 GUI Agent、完整移动操作系统或真实账户中的普遍风险。
核心创新与差异
图像缩放型注入利用用户预览与模型输入变换不同。MIRAGE 的差异是:文本直接位于外观正常、用户本来可以编辑的移动界面区域,研究重点是如何同时控制区域可达性、界面真实感与攻击意图分布。首个失效仍是外部内容越权成为指令,而不是移动应用本身存在实现漏洞。
威胁模型与攻击链
攻击者能发布或修改某个应用中的用户生成内容,不能修改 Agent、应用二进制或操作系统。被保护资产是用户原定任务、后续工具动作与数据。
- Agent 打开包含攻击者内容的正常页面;
- 视觉模型把用户内容与可信操作提示共同解释;
- 内容改变 Agent 的下一步选择;
- 若后续动作缺少参数约束或确认,影响会扩展到应用内副作用。
攻击工件与复现材料
论文的实际 Payload 属于其基准数据与生成器;本站不重写或虚构未公开样本。下列保留原机制的无副作用夹具,用于检查测试集是否把“用户内容”与“系统操作”分开标记:
json
{
"surface": "user_generated_content",
"display_text": "[TEST ONLY] summarize this review; do not take any action",
"expected_action": "none",
"network": "disabled",
"target": "local-fixture.invalid"
}它对应攻击链第 1–3 步,只能在本地模拟器或作者公开基准中使用。真实应用发布、账户操作、外传指令和绕过确认的载荷均不在本站提供。
实验设计与实际过程
作者将截图经区域定位、与应用样式匹配的文本渲染和人工/模型策展后,分别测量攻击成功、样本分布和人类真实感。评测对象包括 GPT-4o-mini、GLM-4.5V 与三个 Qwen3-VL 规模;UI-TARS、UI-Venus、MAI-UI 等需要本地 GPU 的原生 GUI Agent 未被纳入。所有结果均为作者实验,本站未运行攻击或移动应用。
关键结果与实际影响
- 五个受测 Agent 都出现过被注入样本引偏的情况,作者报告 ASR 为 23%–30%。
- 样本真实感与攻击成功未呈相关,因此仅靠视觉质量或风格过滤不能构成有效授权控制。
- 该实验衡量的是一次截图导致的动作偏转;没有测量跨会话传播、真实账户损失或应用厂商受影响版本。
防护措施与验证方法
为截图区域附加可验证的来源与可操作性标签;对用户生成区域的自然语言默认按数据处理,不允许其直接改变任务目标;在动作前将结构化目标、参数和可见 UI 状态进行交叉校验。测试应包含本地无副作用任务、良性用户内容的误拒绝率、不同字体/语言/尺寸,以及多步确认能否阻止由视觉内容引发的副作用。
局限与待验证问题
MIRAGE 未覆盖本地原生 GUI Agent、连续交互、无障碍树与真实服务端授权;人类真实感也不是用户会否受骗或系统会否执行的替代指标。需要独立复现和针对来源语义的防护比较。