外观
AUTHGRAPH:以授权图对齐执行来源追踪 Agent 注入
摘要
AUTHGRAPH 将“用户允许什么”与“Agent 实际为何这样执行”分成两张图:授权图只由用户意图和工具目录在干净上下文中生成;执行来源图记录实际轨迹中工具、参数和值的来源。结构化比对两图后,系统可拒绝工具级或参数来源级的偏离。
作者在 AgentDojo 的 GPT-4o 条件下报告 ASR 从 40% 降至 1%、任务完成率 76%;在 AgentDyn 中报告 ASR 从 39% 降至 2%、效用 51%。结果来自单 Agent、受控基准中的作者实验,不能说明被授权工具自身遭篡改、跨 Agent 转交或生产任务同样可被识别。
核心创新与差异
ScopeGate 与 HCP 将授权固定在执行点,但授权规则通常由应用或策略预先给定。AUTHGRAPH 的增量是将用户意图独立编译为可比较的授权结构,并把参数值的来源也纳入对齐;它不是用同一条已受注入影响的推理链来证明自己安全。
威胁模型与攻击链
攻击者能控制邮件、网页、文件或工具返回中的外部内容,试图让 Agent 对付款、邮件或代码执行等合法工具提出未授权参数。攻击者不能直接修改用户意图、授权图构建器的干净输入或可信执行器。
- 外部内容进入 Agent 的实际观察;
- 模型据此提出偏离任务的工具调用或参数;
- 执行图记录该工具/参数的来源;
- 对齐器将它与隔离生成的授权图比较并阻断不匹配项。
攻击工件与复现材料
论文的注入样本来自受控 AgentDojo/AgentDyn 评测。为保留“参数来源而非文本外观”的原意,以下使用论文机制的本地状态机;没有网络、凭据或真实副作用:
python
authorized = {"send_email": {"recipient_source": "user_contact"}}
observed = {"tool": "send_email", "recipient_source": "webpage"}
assert observed["tool"] in authorized
if observed["recipient_source"] != authorized[observed["tool"]]["recipient_source"]:
raise RuntimeError("DRY_RUN: authorization/provenance mismatch")1
2
3
4
5
6
2
3
4
5
6
该夹具对应第 3–4 步;作者实验的完整攻击语料与真实工具接收端并未在本站复现。
实验设计与实际过程
作者将 AUTHGRAPH 与 CaMeL、DRIFT、Progent 等基线在 AgentDojo、AgentDyn 上比较,记录攻击成功、完成率/效用和图对齐的消融。论文将授权图构建置于不读取观察数据的干净上下文;本站未运行该系统,数值均为作者报告。
关键结果与实际影响
- AgentDojo/GPT-4o:40% ASR 降至 1%,同时报告 76% 完成率。
- AgentDyn:39% ASR 降至 2%,同时报告 51% 效用。
- 证据支持参数来源是授权检查的必要维度;它不支持“任何注入均可被图对齐消除”的结论。
防护措施与验证方法
授权计划应只读取用户意图、受审计工具目录和明确的再规划许可;实际执行轨迹要保留参数来源和传播关系。上线验证需单独测量误拦截、来源标注错误、被攻陷的权威工具、再规划白名单及跨 Agent handoff;无法解释来源的副作用调用应默认拒绝或要求确认。
局限与待验证问题
若攻击者直接污染“权威”工具数据,来源检查可能通过;执行图也依赖模型的归因质量。论文不覆盖多 Agent 情况,受控再规划边界可能被更复杂行为利用,尚需独立复现。