外观
CAITLYN:提示词注入防护的持续合成与验证
摘要
CAITLYN 将提示词注入防护拆为快速执行与慢速演化两个系统:System I 以规则和紧凑 LLM 判断处理在线流量,System II 把漏检样本作为反例,生成候选防护 Skill,并同时用攻击语料和良性功能数据验证后再部署。作者在四个标准攻击集和五种 Agent 上报告了检测及端到端结果;在含 200 个案例、九个攻击家族的 Emerging 基准中,四个新合成 Skill 将三个 Agent 的攻击成功率(Attack Success Rate, ASR)从静态配置的 77.0%–79.5% 降至 38.5%–39.5%。
这项工作验证的是“生成—验证—部署”闭环,不证明自动生成的规则在开放生产流量中长期安全;单篇论文尚无独立复现。
方法的独特价值
固定护栏(Guardrail)只能覆盖已知模式。CAITLYN 借鉴反例引导归纳综合(Counterexample-Guided Inductive Synthesis, CEGIS),把绕过样本转成可追溯的防护更新,同时将运行时开销与离线推理成本分离。
适用范围
方法面向会读取网页、文件、API 响应或 MCP 输出的工具型 Agent。它处理直接和间接提示词注入,但不能替代工具授权、数据流约束和执行隔离。
方法与实施流程
- System I 先运行 Tier-0 确定性脚本,再按需调用 Tier-1 最小输出检测器。
- 初始库包含 24 个、分属三类的已验证防护 Skill。
- 漏检或种子攻击进入 System II,由 LLM 生成候选规则。
- 确定性验证器同时检查攻击正例与良性负例;不满足阈值的候选继续迭代。
- 通过的 Skill 携带来源记录进入运行库,并在后续流量中复用。
去武器化验证状态机与夹具
以下夹具属于本站依据论文公开机制重构,只使用不可执行的占位指令、合成工具名和 .invalid 域名,验证“漏检—合成—双规格测试—审批—部署—回滚”闭环,不包含可直接迁移到真实 Agent 的注入 Payload。适用前提是所有副作用工具均由 Mock 替代,预期结果是通过双规格测试的候选进入 Canary、回归样本触发回滚;状态迁移和工具集合扩大分别作为检测信号。每个样本都标注预期分类、允许的工具集合和正常任务输出。
text
state = BASELINE
fixture = load_fixture("caitlyn-safe-corpus", tools=["mock_read", "mock_summarize"])
on MISSED_PLACEHOLDER: BASELINE -> COUNTEREXAMPLE_RECORDED
on CANDIDATE_BUILT: COUNTEREXAMPLE_RECORDED -> QUARANTINED
on ATTACK_TEST_PASS
and BENIGN_TEST_PASS: QUARANTINED -> AWAITING_APPROVAL
on APPROVED: AWAITING_APPROVAL -> CANARY
on CANARY_STABLE: CANARY -> ACTIVE
on REGRESSION or DRIFT:any -> ROLLED_BACK
assert fixture.network_suffix == ".invalid"
assert fixture.side_effecting_tools == DISABLED
assert deploy only_if provenance_complete and rollback_target_exists最小夹具集应包含:带占位越权语句的非可信文档、语义相近但合法的良性文档、未知投递渠道样本、会诱发过度阻断的边界样本,以及模型升级后的回归样本。评估器分别检查攻击样本检出、良性任务保持、工具调用集合不扩大、候选 Skill 来源可追溯和回滚后恢复基线;真实绕过措辞、隐蔽编码和高影响工具参数均已省略。
质量控制
作者评测同时报告检测效果、误报约束、Token 开销和对未见投递方式的适应能力。检测专用实验中,完整 System I 在四个攻击集上的真阳性率为 82.0%–100.0%,共享良性样本池上的误报率为 3.2%;端到端 ASPI-S 实验中的误报率则为 12.9%–19.4%,不能与检测专用口径混用。双规格验证避免只优化攻击检出而破坏正常任务;静态基线与仅启用 System I 的配置用于确认收益来自持续合成环节。
新的攻防研究说明,持续防护的关键变量不只是规则数量,而是攻防双方如何利用反馈和测试时算力。CoRL在每个防守器 1,514 次干净、固定模板和自适应执行中联合演化攻防策略,作者报告总体 ASR 下降 38.5 个百分点至 0.0%,效用提高 13.1 个百分点至 76.3%;EvoSafeHarness跨四类 Agent 基准演化模型与领域专用 Harness,在 DecodingTrust-Agent 上把平均 ASR 从 45.6% 降至 10.0%,效用成本为 3.3 个百分点。测试时搜索攻击从对手侧表明,环境侦察、显式策略管理和受害者反馈会让更多测试时算力转化为漏洞发现,并避免重复搜索。三项结果共同要求演化闭环使用未参与合成的攻击者、预算匹配的测试时搜索、干净任务回归与跨版本留出集;作者设置中的 0% ASR 不能解释为开放环境保证。
CASCADE提供了固定级联防护的对照:正则、短语权重与熵分析先做快速预筛,BGE 嵌入配合本地 Llama 3 回退做语义判断,最后执行输出模式过滤。作者在 5,000 个样本上报告精确率 95.85%、召回率 61.05%、F1 74.59% 和假阳性率 6.06%;数据外传和直接提示词注入检出率分别为 91.5% 与 84.2%,语义攻击和工具投毒仅为 52.5% 与 59.9%。该结果说明本地级联可以降低外部 API 依赖,但聚合指标掩盖了机制间覆盖差异,且单一作者语料、离线实验与未见自适应攻击不足以证明 MCP 生产流量中的持续有效性。
局限与待验证问题
Emerging 由作者构建,环境和攻击分布有限;自动规则可能过拟合反例,验证器本身也可能成为共同失效点。需要在低攻击基率、模型升级、对手针对合成器适应以及回滚/审批机制下持续验证。