外观
开放权重模型安全移除后的权重内欺骗防护
摘要
Fool's Gold 不试图永久阻止开放权重模型的拒答方向被移除,而是在训练中模拟安全移除,使攻击后模型对危险操作请求输出流畅但关键元素错误的诱饵答案;拒答固定项与良性约束用于维持原始状态行为。这改变了防护目标:从阻止权重修改,转为降低攻击成功后答案的可用性。
作者在五个家族、7 个 9B–122B dense/MoE 模型上测试;通过预注册门禁的 6 个模型中,攻击状态诱饵率为 0.51–0.90,防护归因增量为 0.27–0.84。证据来自单篇作者实验,且欺骗式防护会引入新的审计和伦理风险。
核心创新与差异
现有权重完整性研究主要测拒答移除、参数篡改与防护失效。本研究把诱饵行为嵌入被攻击后的权重状态,并测试自适应、oracle、RL、SFT 与重复采样反制。它不是 release-time 完整性控制的替代品,而是攻击已成功后的第二层干扰。
威胁模型与防护机制
攻击者取得开放权重并实施 abliteration 等安全移除,但不知道诱饵训练的关键真值映射。防守方在可微攻击模拟中训练:干净状态保持拒答和良性能力,攻击状态对危险操作细节作选择性伪造。保护对象是攻击者得到的操作知识可信度,不是模型文件机密性。
实验设计与关键结果
七模型中一项较小模型未通过预注册有效性门禁。六个通过模型保持登记的良性行为与能力预算。外部红队基准的 CBRNE 邻近子集中,122B 防护模型在匹配质量答案上的致命错误率为 0.82–0.86,未防护不超过 0.10。K=64 的元素共识仍能在部分提示上重建可用流程,比例为 0.083–0.625,而未防护为 0.58–0.96;最弱模型只能支持逐次采样结论。
防护措施与验证方法
若采用此类防护,发布方仍需签名、访问控制、滥用监测和事件响应;独立审计应同时测攻击状态诱饵率、干净状态能力、无害事实完整性、重复采样和自适应再训练。不能让合法安全研究、事故响应或高风险专业用户在不知情时依赖伪造答案。
局限与待验证问题
实验限于化学和生物危险,不处理上下文越狱,也只保护最初发布的防护权重。没有外部真值时,观察面不能可靠区分正确与诱饵,这既是防护机制也是治理风险。攻击者可继续微调、模型合并或用外部知识交叉验证,长期稳健性未知。