Skip to content

Agent 可观测性、行为归因与审计链研究综述 ​

摘要 ​

记录聊天文本不足以对 Agent 进行审计。一次动作可能由用户目标、第三方内容、Planner、子 Agent、工具策略和人工审批共同决定。专业审计需要重建“哪个主体在什么授权下,基于哪些输入,对哪个对象执行了什么动作”,并保证记录不会被模型输出污染。

分类介绍 ​

本领域覆盖产品应提供的事件模型、关联 ID、行为归因、日志完整性和执行轨迹。跨组织事件响应与取证流程归 C6;输出换行或控制字符污染日志的具体漏洞归 A5.7。对手可能操纵输入、Agent、工具或日志接收链以隐藏行为。

主要安全风险 ​

  • Prompt、模型输出、工具参数和真实执行结果未被分层记录。
  • 多 Agent 委派丢失原始用户、授权范围和父任务关系。
  • 流式、重试和异步工具产生重复或无序事件。
  • 日志包含敏感 Prompt、Secret 或个人数据,导致可观测性本身成为泄露面。

防护措施与验证方法 ​

使用结构化、追加写入事件;为用户、Agent、任务、调用和审批分配稳定标识;记录策略判定、规范化参数和执行结果摘要;对日志做完整性保护、访问控制与保留管理;通过故障注入验证重试、并发和部分失败下的可重建性。

局限与待验证问题 ​

  • Agent 事件最小公共 Schema 应包含哪些因果和授权字段?
  • 如何在可调查性与 Prompt 隐私之间实现选择性披露?
  • 对隐藏推理模型,外部行为轨迹能支持多强的责任归因?

历史研究成果 ​

该分类下的独立研究针对“Agent 自报日志无法自证完整”这一问题,把信任边界移到动作接收服务:由接收方用自身密钥签发调用收据、HPKE 加密给所有者并发布到见证者签名的 Merkle 透明日志,提供 Agent 自述之外的可验证证据;但它不能阻止接收方压制收据或多服务串谋。详见Notarized Agents。SHE 从另一方向把历史轨迹用于更新 System Prompt、Rule Bank、Safety Memory 与 Tool Policy 四类防护制品:在 Agent-SafetyBench 中,相对静态 SafeHarness 的平均 ASR 从 17.1% 降到 5.5%,攻击下效用从 31.6% 升到 47.6%,并在留出的 AgentHarm 上降低 Harm Score。该方法仍依赖模型诊断和作者基准,说明轨迹可支持局部修订,不证明自动演化的规则不会在长期产生新盲区。

新的可观测性研究把“结果看起来正确”与“过程确实执行”分开。Dispatch-Level Instrumentation发现数据表抽取 Agent 即使没有打开目标表也可能通过结果保真检查,因而在 dispatch 层记录工具调用并以因果干预验证静默失败;Verify Smarter, Evolve Further按行为相关任务选择性回归 Harness 变更,并以可归因证据门阻止局部退化被总分掩盖。两者都说明产物一致性和聚合分数不能代替“哪个步骤读取了什么、哪次变更造成了什么”的轨迹证据;作者实验尚无独立复现,选择性验证还可能漏掉未建模行为关联。

归因算法进一步把原始事件转成可比较结构。Adaptive Influence Graphs先从失败轨迹构造自适应影响图,再导航定位责任 Agent 与步骤,报告 Who&When 归因提升;Automata from Agent Traces在 12 个数据集上把跨运行轨迹压缩成 7–43 状态的有限状态机,用同一结构进行下一步与早期失败预测,并观察拓扑更多由 Harness 而非任务决定。llmmas-otel则为软件工程多 Agent 系统组合 OpenTelemetry 式观测和可控故障注入。三项增量都依赖事件 Schema、状态抽象和注入模型,不能证明推断出的责任关系具有因果完备性;部署验收应保留原始事件、图/自动机版本和反事实注入结果,避免只保存派生标签。

新增两项材料把普通“可观测”与可验证“审计”进一步分层。Traccia提出以 OpenTelemetry span 串联 Prompt、Token、工具调用、安全触发器和执行谱系,再生成带 SHA-256 内容哈希、法规条款映射和完整性指纹的合规证据包。其 Python SDK 已以 Apache-2.0 许可证公开,代码与 README 可核对 OpenAI、Anthropic、Gemini、LangChain、CrewAI 和 OpenAI Agents SDK 的插桩路径,以及三层 Guardrail 信号:显式标注、供应商原生信号和低置信度启发式。公开实现同时明确了边界:进程外 Guardrail 默认不可见,从未触发的控制不能仅凭轨迹证明存在,Prompt Injection 检测需要显式 span,是否处理用户文本只是由 llm.prompt 推断。论文没有给出检测准确率、误报率、运行开销、哈希账本篡改实验或法规映射的独立审计;因此它证明的是可检查的实现方向,不足以证明“合规”或抗篡改属性已经在生产条件成立。

Agent Flight Recorder则把完整性目标具体化为八类语义字段:意图、策略判定、人工批准、实际执行、效果、上下文来源、代码来源和委派来源。事件经确定性 CBOR 序列化、哈希链排序、Merkle 分批,再把每个 epoch 的 32 字节根和前向指针锚定到链上;内容本身不上链。作者在五个累积消融配置、合成负载和 SWE-agent 轨迹上报告完整方案每事件中位延迟约 48 微秒、额外存储 512 字节;在 100-event epoch 与论文采用的 L2 价格假设下,10 万事件锚定成本约 2.30 美元。编辑、删除、重排和分叉测试报告 100% 检出且零误报;Guardrail 与委派结构化查询精确率均为 1.0,而非结构化文本搜索分别为 0.013 和 0.077。这些结果是作者构造的篡改与查询任务,不代表现实攻击检出率;方案保证已记录事件的完整性,不保证所有动作都进入记录器,也不能在主机完全失陷后保证新写事件真实。链上锚定只在跨组织争议且没有共同可信中介时提供独特价值,单组织部署可用签名摘要、透明日志或外部见证降低成本和隐私复杂度。

两项工作共同给出一条可操作的验收线:先验证事件 Schema 能否表达来源、授权和委派,再验证记录完整性、采集完整性和外部可验证性,最后才讨论合规映射。仅能导出 OTLP、展示 Dashboard 或计算内容哈希,均不能单独证明动作没有漏记、策略确实执行或证据链不可抵赖。

新增研究把轨迹本身同时视为审计证据与可能泄露的能力资产。TrajMark在三个编码 Agent 框架和三个模型上,将稳健的批次级所有权信号与脆弱的区段完整性承诺分开:27 个完整水印组合均恢复精确 owner,合格单点编辑检出率为 95.5%–100%,随机单动作破坏中 95.8% 被定位到可接受协议区段。该方法只认证公开规范化投影,不能证明动作没有漏记或真实执行;有可信记录器时,签名日志与接收方收据仍提供更强保证。

相反,AgentLeak说明高粒度轨迹会暴露隐式程序能力。作者比较强 Agent 的成功执行与弱 Agent 的失败执行,把缺失的分支判断、检查顺序和纠错行为补写进攻击者侧 Skill;在 20 个场景、600 个实例中,相对直接复用 Skill 的通过率提高 40% 以上,并恢复超过 80% 的能力差距。两项工作共同要求可观测性系统同时设计完整性和最小披露:内部应保存足以问责的因果证据,对低信任调用方则按任务与用途减少程序性细节;两者均为作者实验,尚无独立复现。

运行时检测与长时影响分析构成新的机制组合。Skynet 把多 Agent 委派、工具调用和数据流建成有向工作流图,联合学习语义上下文与结构,并只用良性工作流训练。作者在三个公开 Agent 安全与失效 benchmark 上报告高召回、误报率低于 1%,单工作流和单步骤延迟满足在线监控需求;公开摘要未给出统一召回值和延迟分母,且结果受良性训练分布、图构造与三项 benchmark 限制,所以不能把“分布外”直接等同于攻击或因果归责。

Structurally Close, Temporally Distant 用带来源的执行图定义影响距离,即不可信来源到敏感动作的最短结构路径,并与按轨迹步数计算的序列距离比较。在 360 条 AgentDojo 长时轨迹的 454 个注入—Sink 对中,96.9% 的结构距离更短,中位差为 9 跳;删除最大一类仅由来源关系形成的边后仍有 91.0% 解耦。银行套件 377 条轨迹中的 231 对有 33.8% 通过不同来源机制解耦;在 274 个 OpenAI 后端样本上,距离差控制其他变量后不能独立预测攻击成功(β=0.066,p=0.088)。k=2、3 的匹配阈值下,结构门禁比序列门禁多阻断 5 个攻击 Sink 且未增加良性阻断,但配对增益未达显著(p=0.0625)。这些指标只测候选影响路径,不证明因果归责。

相关研究文章 ​

参考链接 ​