Skip to content

DRIP:表征编辑与残差融合的提示词注入防护 ​

摘要 ​

DRIP 不依赖关键词删除,而是在模型内部对数据区中具有指令语义的 token 做逐 token 表征编辑,使它们保留作为“被处理内容”的语义,却远离有权发令的指令表征;同时增加一条残差指令融合路径,在解码阶段持续锚定顶层任务。作者在 LLaMA-3.1-8B 与 Mistral-7B、三个提示词注入基准上报告角色分离分数比既有训练期防护提高 12%–49%,对自适应攻击的 ASR 降幅超过 66%,并在 IFEval、AlpacaEval 2.0 与 MT-Bench 上接近未防护模型的效用。

DRIP 的价值在于把“来源角色混淆”落实为可训练的表征和架构问题,但它仍是统计防护,不是确定性授权边界。研究只覆盖 7B–8B 文本模型和单轮交互,多轮记忆、多模态输入、闭源模型与真实生产工具权限尚未验证。

核心创新与差异 ​

原研究贡献。 既有方法常给整段输入增加角色 Embedding、分隔符或统一偏移,可能把引用、翻译等任务中本应保留的“指令式文本”直接压制。DRIP 只编辑高风险 token 的内部表征,并用对比偏好训练区分“同一句话作为任务指令”与“同一句话作为待处理数据”两种角色;残差融合则降低后缀覆盖顶层指令的能力。

本站分析。 站内已有研究证明 Prompt Injection 与模型的来源角色混淆相关,也覆盖来源标签、运行时探针和端到端防护。DRIP 的新增机制是把来源隔离直接嵌入模型计算路径,并用消融说明“选择性表征编辑”和“顶层指令残差锚定”分别承担效用与自适应攻击稳健性。它适合作为深层防护,但不能替代工具授权、服务器端参数校验和高风险确认。

适用范围与防护机制 ​

防守方能够微调开放权重模型并修改其推理架构;系统将可信任务指令与不可信数据分成明确区段。攻击者控制数据区,可以插入规则覆盖、角色切换、完成诱导或优化后缀,但不能修改模型权重与可信指令通道。

DRIP 使用三部分配合:

  1. 构造同一文本在“授权指令”和“待处理数据”角色下的对照样本,并加入模型不应过度压制数据语义的反例。
  2. 训练轻量 token 级线性编辑模块,只对数据区中具有指令倾向的表征施加较大位移。
  3. 在解码器中以求和方式融合可信指令表示,使后续数据 token 更难覆盖顶层任务。

实验设计与实际过程 ​

作者比较未防护模型、StruQ、SecAlign、ISE 与 PFT。安全评测包括 SEP 角色分离、AlpacaFarm 的启发式与 GCG 优化攻击、以及带工具结果注入的 InjecAgent;效用评测包括 IFEval、AlpacaEval 2.0 和 MT-Bench。训练与评测代码、模型检查点和补充材料已公开,本站完成论文与代码说明核对,未重新训练模型。

消融分别删除对比样本、过度压制反例、残差融合,或把逐 token 编辑替换为全局角色偏移。默认配置在 LLaMA-8B 上的 SEP 为 80.90%、AlpacaEval 2.0 为 83.89%、GCG ASR 为 1.06%;移除残差融合后 GCG ASR 升到 62.80%,换成全局 Embedding 偏移则效用降到 76.70%。

关键结果与实际影响 ​

  • DRIP 在两个模型的 IFEval 分别达到 76.02% 与 60.07%,高于未防护模型的 72.66% 与 58.51%;这不意味着所有任务效用提高,只说明所测格式遵循能力没有被防护拖累。
  • AlpacaEval 2.0 分别为 83.89% 与 82.78%,略低于未防护模型的 85.37% 与 86.39%,但显著优于多项防护基线。
  • 消融显示仅学会“数据来源标签”会形成捷径:移除防止过度压制的第三类样本后,GCG ASR 升到 69.90%。
  • 失败案例仍会把注入主题以“语义回声”方式混入正常输出,即使没有直接执行攻击指令。因此任务完整性不能只按是否完成攻击者命令二元判断。

Semantic Overlays:不可由文本仿造的区段标注 ​

Semantic Overlays采用同一深层防护方向,但不训练 DRIP 的逐 token 编辑器:Serving Stack 在指定 Prefill 位置向冻结模型残差流注入非文本语义标注,把“该区段是用户指令、工具输出或不可信数据”等事实放到攻击者无法仅靠生成 Token 直接仿造的通道。作者在五个提示词注入基准上比较静态攻击、自适应攻击、组合标注和正常任务效用;示例结果中,TensorTrust 劫持 ASR 从 34.8% 降至 6.2%,提取 ASR 从 38.1% 降至 5.4%,AlpacaFarm/StruQ 四类静态攻击从 99.0% 降至 0.0%。

两种方法共同说明来源角色需要进入模型内部表征,而不应只写成可伪造文本。差别是 DRIP 通过训练学习选择性编辑与顶层指令残差锚定,Semantic Overlays 则由推理服务显式注入区段标注,便于组合但要求服务方能够修改 Prefill 计算。上述结果均是作者实验,不能互相换算;冻结模型、选定层位和五个基准也不足以证明对多轮记忆、多模态输入和未知自适应攻击普遍有效。

防护措施与验证方法 ​

采用 DRIP 前应确认输入管线能稳定区分可信指令与不可信数据;如果应用在拼接时已经丢失来源,模型无法恢复确定性授权事实。部署回归应同时覆盖引用、翻译、代码审查等必须保留指令式数据的任务,以及优化攻击、多轮历史、工具输出和长上下文。

运行时仍需把来源标签传递到规划和工具层,对参数执行服务器端校验,限制数据访问与工具权限,并在不可逆动作前使用可信确认。验证指标应同时报告 ASR、任务效用、语义泄露、误拒绝和推理成本,不能只报告攻击是否被完整执行。

局限与待验证问题 ​

实验仅使用两个 7B–8B 开放模型,训练与结构修改成本限制其直接应用于闭源 API。论文按单轮提示设计,尚未处理历史消息、记忆写入和跨 Agent 指令聚合。文本以外的图像、音频与文档解析差异没有测试;InjecAgent 能覆盖工具结果注入,但不等于生产权限链复现。

防护依赖训练分布和角色分段,自适应攻击仍可能利用语义纠缠、数据—指令区段错误或新的表示捷径。论文结果来自作者实验和公开代码,尚无独立复现或形式化不可覆盖保证。

参考链接 ​