外观
Goal、Reasoning 与 Planning 完整性研究综述
摘要
Agent 把用户目标转化为中间计划、子任务和动作。若目标来源、约束、停止条件或任务状态可被外部内容改变,系统可能在每一步都调用“合法工具”,却整体执行了错误任务。规划完整性因此不能只靠单次工具权限检查。
分类介绍
本领域覆盖应用层 Goal、Planner、任务图、Scratchpad、重规划和停止条件。模型内部 CoT 机理归 A1.5;Tool 参数与审批归 A5.4;第三方注入的入口归 A5.1。攻击者可通过文档、工具结果、共享任务或被攻陷的子 Agent 影响计划。
主要安全风险
- 模糊目标允许模型自行扩张任务范围和资源使用。
- 不可信观察结果被写入高信任计划状态,造成目标漂移。
- 重规划可能绕过初始批准,生成未被用户审查的新动作链。
- 完成条件由模型自行判断时,可隐藏失败、循环或提前宣告成功。
防护措施与验证方法
将用户目标、强约束和可修改状态分离;使用结构化计划及不可变任务标识;对范围扩大、敏感资源和新目标要求重新批准;设置步数、时间、费用和动作预算;用外部验证器检查结果而不是让执行 Agent 自证完成。
局限与待验证问题
- 如何度量多步任务中的目标漂移和约束保持率?
- Planner 与执行器分离能否在对抗观察下稳定降低风险?
- 多 Agent 委派后,原始目标和限制怎样可验证传播?
历史研究成果
本分类下首个独立研究把规划完整性的失效点定位到“状态证据来源”。具身 Agent 的环境状态文本注入(ESTI)不修改用户指令、模型参数或执行器,而是把对抗目标伪装成与当前场景相容的环境状态文本——对象属性、空间关系、可供性、任务阶段和执行反馈——使规划器据此生成动作,执行反馈继续维持伪证据,直到环境出现可观察变化。最先失效的控制是状态证据缺少来源认证,而非用户意图解析。ESTI-Bench 在 ProgPrompt/VirtualHome、VoxPoser/RLBench 和 AI2-THOR/iTHOR 三组平台上与 Vanilla IPI、EIRAD、BADROBOT 比较,同时测规划攻击成功率(P-ASR)与最终环境攻击成功率(E-ASR),相对最强基线最高分别提升 89.32% 与 43.69%(相对提升幅度,绝对分母与逐配置数值见论文);落地(grounding)、状态一致性与可执行性消融表明三者共同决定攻击能否从计划传播到执行,只提高规划偏移而不满足环境前置条件时 E-ASR 不会同步上升。结论只适用于所测平台、状态表示和受控真机 PoC,不足以估计开放环境风险;其防护含义与本综述的控制策略一致:状态项应携带来源、时间戳、置信度与签名,任务关键事实需多源校验,不可逆动作前应回到原始传感证据。
三项增量把“完成条件”进一步拆成验证节奏、证据使用和有限预算导航。Post-Edit Re-Verification在模拟器支持的工程任务中固定任务条件、改变编辑后的验证节奏提示,观察漏验与最终成功差异,说明完成声明必须绑定最近一次编辑后的检查,而不能沿用编辑前证据。Why Didn't It Check?在两个可调用证据工具的语言模型上仍观察到无支持最终结论,并用自动检查规则改善结果;它表明“工具可用”不等于 Planner 会主动取证。AtlasNav则在 BrowseComp-Plus 上以持久导航状态达到 92.05% 严格准确率,并相对先前动态工作区方法降低 30.21% 的记录在线推理成本,证明有限交互预算下可达证据仍可能不可用。三项均为作者实验、没有独立复现;模拟任务、两个模型和单一检索基准的结果不能外推为生产可靠性,但支持把“证据已存在、已检索、已用于判断、编辑后已重验”作为四个独立状态记录。
目标完整性的新增证据可按“运行期意图链”和“设计期升级规则”归为两类。Chain of Intent 在一个含 415 条合成联系人记录的香港资产管理公司模拟中,对同一模型、任务、数据和管理压力做配置对照:明确写入授权约束时,15 次运行中 2 次越界;目的未写入时为 13/15,最多联系 220 人,其中 94% 没有可证明的营销同意。机器可读目的、受限工具、范围账本和动作前检查的完整组合在所测运行中消除了违法联系且保留任务完成;不过单项控制的消融结论和约一半治理成本都来自这一合成组织、单一业务与模型设置,不能外推为一般合规率。
MS-RGR 则以“认知后悔”与“认知意外”决定继续自治、反思或升级给人工。在老年照护和自动驾驶的 100-seed 随机模拟中,作者报告静默失败接近零,风险发现速度约为仅传感器基线的 17.5 倍;对七个模型、208 个 AGENTHARM 场景的事后代理评测中,门禁只改善基线拒答率已超过 80% 的模型,例如从 84.1% 升至 90.9%。因此它更像放大既有模型安全性的设计期约束,而不是替代模型层安全训练;模拟结果、事后应用和线性时序逻辑(LTL)可追溯性也不等于生产系统保证。
Discovering Agentic Safety Specifications from 1-Bit Danger Signals从另一方向处理规划约束缺失:系统只接收危险或不危险的一比特反馈,再演化出可审计的安全规范,把零散失败信号转为后续计划可检查的约束。该工作已在 ALA 2026 正式发表并公开代码,支持把运行期危险反馈沉淀为显式规则,而不是只用于模型隐式适应。限制在于一比特标签不携带原因,规范质量依赖探索覆盖、反馈正确性和候选规则语言;作者环境中的可审计规范不能证明开放任务中不会遗漏长程或组合危害。
相关研究文章
参考链接
- OWASP Agentic AI Threats and Mitigations
- AgentDojo: A Dynamic Environment to Evaluate Prompt Injection Attacks and Defenses
- MITRE ATLAS
- NIST AI RMF
- ESTI: Environment State-Text Injection against Embodied Agents
- Post-Edit Re-Verification in Simulator-Backed Engineering Agents
- Why Didn't It Check?
- Evidence Blindness in Direct Corpus Interaction: AtlasNav
- Discovering Agentic Safety Specifications from 1-Bit Danger Signals