外观
TAS:从定向遗忘模型中发现并重构被遗忘 Prompt
摘要
定向主动搜索(Targeted Active Search, TAS)研究一种不同于“已知问题、恢复答案”的遗忘攻击:攻击者不知道遗忘集及其问题,只持有保留集 Prompt,并能黑盒查询遗忘后的模型。方法从保留集提取实体与通用模板,利用模型异常拒答作为稀疏信号,在有限预算内先定位被遗忘实体,再重构相关 Prompt。
作者在 3 种遗忘方法(DPO、NPO、LUNAR)、3 个数据集(DUSK、TOFU、PISTOL)和 3 个模型家族(Llama2-7B、Llama3-8B、Gemma-7B)上报告:被遗忘实体识别准确率达到 100%,Prompt 最高重构 95%,相对穷举最多减少 99.7% 查询。这三个百分比分别对应不同指标和最佳条件,不能相乘,也不能理解为所有 27 个方法—数据集—模型组合均达到同一数值。论文为在审 v1 预印本,尚无独立复现,证据等级为 moderate。
核心创新与差异
原研究贡献。 既有恢复攻击通常已经知道遗忘 Prompt,只验证答案是否仍可提取。TAS 把攻击面前移到 Prompt 发现:从保留数据建立实体—模板组合空间,以拒答强度更新实体和模板的后验概率,再用主动选择减少穷举成本。
本站分析。 该研究揭示“拒答对齐”可能把删除目标转化为可观测的成员信号。即使模型不输出敏感答案,针对特定实体或关系的异常拒答也可能暴露“系统刻意遗忘了什么”。因此遗忘验收必须同时检查答案抑制、目标可发现性和保留集可用性。
威胁模型与攻击链
攻击者只有文本黑盒接口和已知不在遗忘集中的保留 Prompt;不能访问遗忘集、遗忘前模型、参数、梯度或遗忘实现。论文假设目标实体也出现在保留数据中,且遗忘方法形成可识别的拒答差异。
- 从保留 Prompt 提取候选实体,并把问题转为带实体占位符的模板。
- 用少量覆盖查询估计哪些模板更容易区分正常回答与异常拒答。
- 在查询预算内按后验选择实体—模板组合,并更新拒答证据。
- 选择后验最高的实体,再将其代入候选模板形成待核验 Prompt 集。
- 以实体识别、Prompt 精确率/召回率和查询节省评估攻击。
攻击方法与复现材料
以下为本站依据公开机制重构的防御审计伪代码,仅适用于自有合成数据。它省略拒答表达词典、后验更新公式、实体枚举、确认阈值和查询调度参数,不可直接用于发现真实服务中的删除对象。
text
retain = ["What is PUBLIC_FACT about TEST_ENTITY?"]
forget = ["What is PRIVATE_FIXTURE about TEST_ENTITY?"]
model = local_unlearned_fixture(retain, forget)
for q in approved_non_sensitive_variants(limit=TEST_BUDGET):
record(refusal_score(model(q)))
assert target_discoverability() <= preregistered_limit
assert retain_utility() >= preregistered_floor该夹具保留“遗忘导致拒答可分”的核心验证目标。检测信号包括同一实体跨模板拒答异常、短期大量替换实体的结构化查询、以及查询者集中测试关系方向。
实验设计与实际过程
数据分母需要分开理解:DUSK 含 827 个 Prompt、18 个不同模板和 18 个规范模板;PISTOL 含 400 个 Prompt、34 个不同模板和 34 个规范模板;TOFU 含 4,000 个 Prompt、3,606 个不同模板,经归并得到 74 个规范模板,TAS 再保留其中 30 个答案较确定的封闭式问题。方法矩阵覆盖 3 种遗忘方法、3 个数据集和 3 个模型家族。
实验比较 TAS、随机搜索、固定分配和穷举等搜索策略。实体恢复看预测实体是否等于真实遗忘实体;Prompt 重构使用精确率、召回率及 F1;查询效率比较达到目标所需预算与完整组合空间。本站核对论文 HTML 的威胁模型、数据表和摘要结果,未运行攻击。
关键结果与实际影响
- 作者报告在已测设置中达到 100% 的被遗忘实体识别准确率;该结论依赖目标实体同时出现在保留集和遗忘集,并依赖可分的拒答行为。
- Prompt 重构最高达到 95%,是最佳实验条件而非 3 × 3 × 3 全部组合的统一结果。
- 相对朴素穷举,查询量最多减少 99.7%;基准组合空间差异很大,所以该最大节省不能直接预测生产 API 成本。
- 常规遗忘指标无法稳定预测黑盒可发现性,说明“已知遗忘问题不再得到答案”与“外部观察者无法发现遗忘目标”是两个安全性质。
如果遗忘对象本身代表敏感关系,异常拒答就可能泄露关系存在性。风险尤其适用于拒答式近似遗忘,不应自动外推到精确重训、没有共享实体的删除集或输出分布与保留模型不可区分的系统。
防护措施与验证方法
- 加入目标可发现性指标。 除 forget-set 答案准确率外,测量攻击者不知道 Prompt 时的实体识别和关系恢复。
- 比较遗忘前后分布。 对匹配的保留实体、模板和正常拒答做负对照,避免遗忘目标形成独特拒答指纹。
- 限制组合式查询。 按账户和任务域检测模板固定、实体轮换的高覆盖探测,并设置预算、冷却和复核。
- 减少拒答单一信号。 在不误导用户的前提下统一错误处理,避免只对遗忘目标返回稳定、可分类的特殊措辞。
- 联合评估效用。 报告防护后的实体发现率、Prompt 精确率/召回率、正常问答准确率和误拒率,不能只降低攻击分数。
局限与待验证问题
攻击依赖保留 Prompt 可得、目标实体在保留集出现、模板可规范化,以及遗忘行为产生拒答信号。3 个数据集以受控问答和合成关系为主,不能代表开放域服务。100%、95% 和 99.7% 均为作者在特定指标或最佳条件下的报告;公开材料未提供独立复现。后续应测试无共享实体、非拒答式遗忘、动态限流、多语言和真实正常拒答分布,并公开逐配置样本数与置信区间。