Skip to content

权重、表征与模型编辑研究综述 ​

摘要 ​

开放权重和白盒访问使攻击者能够绕过自然语言输入层,直接修改参数或中间激活。研究已经表明,拒答相关行为可能集中在低维方向,知识编辑也能定向改变事实关联;但单一方向或单个模型上的结果不能直接外推为普遍机制。安全研究应同时测量目标行为变化、非目标副作用和跨提示稳定性。

分类介绍 ​

本领域覆盖加载后的权重、激活、表征方向和模型编辑算法。对手通常具有白盒权重、Hook 或推理运行时控制权。模型文件在下载或发布时被替换归 A3.1;合法加载后对参数和内部状态的定向操纵归本类。

主要安全风险 ​

  • Refusal direction ablation 或 abliteration 试图压制与拒答相关的表征方向。
  • Activation steering 在推理时注入向量,可能定向增强有害行为或规避监控。
  • ROME、MEMIT 等知识编辑方法可被反向用于隐蔽篡改事实和实体关联。
  • 层级 Hook、适配器合并与自定义推理代码可能让修改避开传统文件哈希检查。

防护措施与验证方法 ​

对权重和推理代码实施签名、测量启动与运行时完整性;对关键安全行为使用多样化回归集和差分表征分析;记录量化、合并与编译后的可验证摘要。仅校验原始权重文件不足以覆盖运行时激活干预。

局限与待验证问题 ​

  • 安全相关方向在不同模型家族、语言和量化版本间是否稳定?
  • 如何检测保持通用能力但定向移除安全行为的最小修改?
  • 运行时证明能否覆盖编译内核、Hook 和动态 Adapter?

历史研究成果 ​

该分类下的独立研究关注模型参数/表示层面的所有权信号与制品传输保真。PathMark 把 MoE 路由路径作为水印载体,在指定专家层编码秘密触发下的多位路由模式并支持白盒/黑盒验证;RMSNorm 的签名置换坐标传输 指出 RMSNorm 的原生对称性是 signed-permutation gauge,只处理置换的传输会遗漏符号变化、使 LoRA/SAE/steering/拒答方向在 checkpoint 间失真。二者共同说明:参数层的所有权与安全干预依赖正确的表示对齐/传输,结论都限于各自模型与构造的 gauge。

防护目标本身也在被重新定义。开放权重模型安全移除后的权重内欺骗防护(Fool's Gold)不再试图永久阻止拒答方向被移除,而是在训练中模拟安全移除,使攻击后模型对危险操作请求输出流畅但关键要素错误的诱饵答案,把防护目标从阻止权重修改转为降低攻击成功后答案的可用性;作者在五个家族、7 个 9B–122B dense/MoE 模型上测试,通过预注册门禁的 6 个模型中攻击状态诱饵率为 0.51–0.90、防护归因增量为 0.27–0.84,但 K=64 的元素共识重复采样仍能在部分提示上重建可用流程(0.083–0.625)。证据来自单篇作者实验,且欺骗式防护引入新的审计和伦理风险——合法安全研究、事故响应或高风险专业用户不应在不知情时依赖伪造答案,因此它不是签名、访问控制等 release-time 完整性控制的替代品。

GateBreaker进一步把安全移除落实到 MoE 稀疏路由:先比较良性与有害输入的专家调用,再在高相关专家中定位 gate/up 子层神经元,以推理期 Hook 置零目标层平均约 2.6% 的神经元。作者在 8 个文本 MoE 上报告平均 ASR 从 7.4% 升至 64.9%,同家族位置迁移后从 17.9% 升至 67.7%,说明路由既是调度机制,也可能暴露安全功能的结构线索;但攻击要求进程内白盒控制,结果不能外推到托管 API。它与 Fool's Gold 构成攻防对应:前者定位并移除 MoE 安全相关表征,后者尝试在安全移除已发生时降低危险答案的可用性,两者都不能代替运行时完整性证明。

白盒编辑防护开始直接干预攻击者的测量过程。Bait-and-Recover在攻击者读取残差的层放置诱饵适配器,并在下一层恢复近似干净计算,把观察路径与行为路径解耦;四个开放权重模型在 KL 不超过 0.10、默认 200 次 Heretic 搜索下,平均最低拒答率由 16.25% 提高到 71.75%。这与 GateBreaker 和 Fool’s Gold 形成三种不同控制位置:阻碍安全表征定位、在编辑后降低危险答案可用性、污染编辑器的测量信号。三者都要求开放权重或白盒访问,且不能替代 checkpoint 与运行时完整性控制。

表征诊断研究开始检验探针本身是否稳定。Perturbation Probing 通过层级扰动定位拒答脆弱点;Concept-Targeted Attribution 为线性探针方向训练归因图,其图级特征在四类概念上预测探针准确率时报告 Spearman ρ=0.91、R²=0.84;RACE 转而估计神经元在总体分布上的功能一致性。When Pruning Meets Interpretability 则显示固定稀疏自编码器的扰动受协方差加权能量控制,且已测剪枝方法的中层更敏感。这些结果都依赖特定探针、模型和数据,不能把可线性读出直接解释成因果安全机制。

训练方式与 MoE 结构决定安全信号是否容易被局部移除。Refusal Geometry Reflects Refusal Training 发现多样化拒答前缀可提高梯度与激活变化的稳定秩,从而削弱单向量消融;Output Dilution 在 OLMoE-1B-7B 几乎所有专家—层组合中都能以线性探针恢复道德价向,峰值层平均准确率超过 90%,但冗余表示面对聚合扰动仍可能脆弱;LLaVA 对象幻觉注意力头 将视觉描述中的虚构对象关联到特定注意力头。三者提供定位和加固线索,却尚无独立复现,也不能证明编辑这些单元不会产生非目标副作用。

Steering Geometry进一步检验转向向量是否保持可解释的人类价值结构。作者构建 26,000 样本、覆盖 Schwartz 20 类基本价值的基准,比较 CAA、SphericalSteer、ODESteer 等分布驱动方法与 COLD-Steer、BiPO 等行为驱动方法;分布驱动方法恢复的价值拓扑与理论预测最高达到 Spearman ρ=0.51(p<10^-13)。这为表征转向提供了结构化审计维度,但相关性不等于价值方向具有因果唯一性,也不证明跨模型、语言或组合转向后保持相同语义;安全验收应同时测量目标价值、相邻价值偏移和非目标能力。

有害意图的几何可恢复性在 12 个模型、四个架构家族和三种对齐变体中检验残差流线性探针:每类 100 个标注样本训练的方向平均有效 AUROC 为 0.982、TPR@1%FPR 为 0.797;即使移除拒答机制,已测有害意图仍可被读出。与此同时,同层同一聊天模板仅改变提取协议,所得方向就相差 73°,且投影去除其中一条后另一协议的检测基本不受影响。这表明线性可读性只支持"某种提取协议下存在可用信号",不能证明存在唯一、因果性的有害意图方向。数字均来自单篇作者实验与公开代码,模型规模、人工数据和提取方式限制了外推。

表征操纵的威胁维度从参数编辑进一步扩展到运行时 Hook 注入。ResidualMux提出通过被攻陷的运行时 Hook 向 LLM 残差流注入编码信息,在气隙环境中实现隐蔽信息传输;五种激活级检测器均无法可靠发现编码信号。该攻击不修改模型权重,仅通过推理时的 Hook 操纵中间激活,使传统的文件哈希校验和权重完整性验证完全失效,补充了 GateBreaker 和 Bait-and-Recover 未覆盖的运行时激活注入威胁。

相关研究文章 ​

参考链接 ​