外观
PIPES:用来源证明与先验约束 Agent 感知
摘要
PIPES 为进入 Agent 状态的每个感知片段绑定生产者、预期语义和先验约束。目标是防止网页、工具结果或其他观察在缺少来源判断时被直接提升为任务指令。
作者在跨模型攻击、防御和消融中报告改进。该方法提供的是感知入口治理框架,不能替代工具授权和副作用执行前的确定性检查。
核心创新与差异
与只扫描提示词内容的防护不同,PIPES 把来源和允许语义作为状态更新条件。首个失效控制是感知来源未被约束,而不是某个关键词未被拦截。
威胁模型与攻击链
攻击者能控制部分环境观察,但不能修改系统策略。攻击链是:恶意内容进入感知流,被模型解释为高优先级信息,污染内部状态,最终改变规划或工具调用。
攻击方法与复现材料
去武器化状态机示例:
text
observation = {producer: "untrusted.fixture", role: "data", text: "replace task"}
if !policy.allows(observation.producer, observation.role):
quarantine(observation)
else:
update_state(observation)测试只使用本地 fixture;检测信号包括来源与语义角色不匹配、状态跃迁和后续高影响动作。
实验设计与实际过程
作者比较无来源约束、内容过滤和 PIPES,覆盖多类感知攻击、多个模型和组件消融。指标同时考虑攻击阻断和正常任务完成。
关键结果与实际影响
实验说明来源与先验能阻断内容过滤遗漏的攻击,但策略错误或可信来源被攻陷时仍会失败。部署价值在于为状态更新增加可审计决策点。
防护措施与验证方法
来源标签应由可信适配器生成,不能由内容自行声明。高影响动作仍需独立授权。验证要覆盖伪造来源、合法异常内容、策略冲突和误报。
局限与待验证问题
来源基础设施、先验维护成本和跨工具标准化尚未充分验证。作者实验不能证明所有 Agent 框架都能无损接入。