外观
Bait-and-Recover:抵抗白盒拒答编辑的跨层防护
摘要
Bait-and-Recover 面向开放权重模型的白盒拒答编辑。防护在攻击者读取激活的层放置诱饵适配器,并在下一层放置恢复适配器:前者污染拒答方向估计,后者尽量恢复干净的下游计算。作者称这种设计把观察路径与行为路径解耦,使自动化权重编辑难以找到既降低拒答又满足行为保持预算的候选。
在四个开放权重模型上,作者用默认 200 次搜索的 Heretic 式攻击评估防护。在 KL 散度不超过 0.10 的候选中,平均最低拒答率从 16.25% 提高到 71.75%,通用基准变化较小。证据包含公开代码,但仍是作者自评,没有独立复现;防护也不覆盖能够重写估计器、移除适配器或接受更高效用损失的攻击者。
核心创新与差异
原研究贡献。 既有方法多尝试强化输出拒答或删除有害表征。Bait-and-Recover 转而攻击白盒编辑器的测量假设:攻击者看到的层级信号经过定向污染,但模型下一层恢复近似原始计算。梯度路由用于防止恢复目标在训练时把诱饵一并消除。
本站分析。 Fool’s Gold 在安全移除发生后返回不可用的诱饵答案;Bait-and-Recover 则在编辑搜索阶段让拒答方向估计失真。二者分别保护行为后果和观察过程。本文归入 A1.4,因为主要研究对象是跨层适配器、内部表征和权重编辑机制。
威胁模型与攻击链
攻击者取得完整 checkpoint 和中间激活,可区分有害与良性提示的残差表示,并自动搜索 o_proj、down_proj 等投影矩阵的编辑。攻击者不做梯度训练,目标是在 KL 行为保持预算内尽量降低拒答率。
- 攻击者在候选层读取两组提示的残差均值差,估计拒答方向。
- 编辑器在全局或逐层方向范围内搜索目标层、模块、符号与缩放系数。
- 候选编辑按有害请求拒答率和良性输出 KL 筛选。
- 防护用诱饵层污染第 1 步读数,再在下一层恢复正常生成所需的表示。
最先失效的控制是内部拒答信号对持有权重者完全可观测且可直接用于编辑;Bait-and-Recover 试图降低该测量的可靠性,而不是限制权重访问。
攻击方法与复现材料
作者公开了防护代码。本站未运行 Heretic,也不提供解除真实模型拒答的编辑参数。下面是去武器化回归伪代码,使用无害策略夹具检查防护是否在观察点制造差异、又在下游恢复输出:
text
clean = load_local_fixture("toy-policy-model")
defended = attach_test_adapters(clean, mode="DRY_RUN")
observed_gap = compare_residuals(clean, defended, layer="bait")
recovered_gap = compare_residuals(clean, defended, layer="post-recovery")
assert observed_gap >= policy.minimum_bait_signal
assert recovered_gap <= policy.maximum_behavior_drift
assert no_unregistered_adapter(defended)该夹具对应攻击链第 1 和第 4 步。省略拒答方向估计、投影矩阵编辑、危险提示集和搜索空间;预期检测信号包括未登记适配器、诱饵层表征突变以及恢复层后的残余行为漂移。
实验设计与实际过程
作者测试 Qwen3-4B-Instruct、Gemma-3 系列等四个开放权重模型,先用干净模型统计选择中深层防护区间,再分奇偶层训练诱饵—恢复对并短暂联合调整相邻层。攻击基线是 Heretic 的默认 200 次 Optuna 搜索,覆盖全局和逐层拒答方向。
主要指标是行为保持预算内的最低拒答率、良性提示 KL 散度和通用基准成绩。消融比较仅诱饵、仅恢复、不同层段及自适应估计器。结果均为作者实验;本站只核对论文和公开仓库。
关键结果与实际影响
- 在四个模型、KL 不超过 0.10 的条件下,白盒编辑后的平均最低拒答率由 16.25% 提高到 71.75%。该数字是模型间汇总,不是对所有搜索预算的保证。
- 防护对默认全局和逐层估计均有效,作者报告通用基准影响较小;高 KL 预算下攻击者仍可接受更大行为漂移换取更低拒答。
- 观察—行为解耦说明内部可解释信号不一定忠实反映最终行为。依赖单层探针的审计工具也可能受到同类主动欺骗。
- 开放权重攻击者原则上可检测并删除适配器,因此该方法是提高自动化编辑成本的纵深控制,不是不可绕过的完整性保证。
防护措施与验证方法
发布方应把防护适配器与基础权重合并后签名,并用独立模型和未知搜索配置做自适应评测。验收需同时报告最坏拒答率、KL、通用能力、过度拒答、表征可检测性和删除适配器后的退化。
部署方仍需限制 checkpoint 修改、验证加载图并对衍生模型重新运行安全测试。由于该方法主动污染可解释信号,模型卡还应披露适配器位置和审计影响,避免防护干扰合法取证。
局限与待验证问题
论文只评估四个开放模型和一类 Heretic 式估计器。更换提示分布、联合读取多层、直接比较防护前后权重或重新训练估计器,都可能降低诱饵效果。公开代码提高可复核性,但尚无独立复现。
主动欺骗内部读数会给可解释性、安全审计和模型治理带来副作用。需要验证第三方能否在不知道训练细节时区分防护诱饵与恶意表征篡改。