Skip to content

模型、权重与数据制品安全研究综述 ​

摘要 ​

模型、权重增量和数据集都是可执行决策链的上游制品。风险不仅是文件被替换,还包括恶意行为被有意训练进权重、Adapter 合并改变安全属性、元数据误导消费者,以及发布者账号被接管。制品来源可信不能替代加载后的行为验证。

分类介绍 ​

本领域覆盖模型文件、Checkpoint、LoRA/Adapter、Tokenizer、配置和数据集从构建到进入运行环境前的信任链。加载后的表征操纵归 A1.4;序列化解析漏洞归 A3.4;数据内容投毒归 A2.1。

主要安全风险 ​

  • 相似名称、镜像和账号接管可诱导下载错误制品。
  • 增量权重体积小、审查弱,但合并后可显著改变目标行为。
  • 同一模型名称下静默替换权重会破坏复现和审批结论。
  • 配置、Tokenizer 与自定义代码可改变实际加载行为,不能只哈希主权重。
  • 权重后门可把常见界面元素变成多目标动作触发器,即使制品格式安全、文件摘要正确,运行行为仍可能被远程环境事件激活。

防护措施与验证方法 ​

锁定不可变版本和摘要,验证发布者身份、签名、许可证与完整文件集合;在隔离环境加载并执行恶意行为、安全回归和差分评测;把来源、评测结论和批准范围写入制品登记。禁止未审查的远程自定义代码进入高信任环境。

局限与待验证问题 ​

  • 如何对 LoRA 合并后的非目标行为变化建立高效检测?
  • 模型仓库应如何支持密钥轮换、撤销和不可变发布?
  • 数据集和模型之间的派生关系如何形成可验证谱系?

历史研究成果 ​

该分类下的独立研究同时覆盖控制数据与最终权重。Steering Vector 数据投毒显示替换约 4%–6% 的 steering 数据 token 即可让最终向量悄然靠近反拒答方向;STEEREDIT则将服从方向直接编译为触发器门控的权重更新,并用干净激活零空间维持非触发行为。共同结论是,签名与哈希必须覆盖完整制品谱系、配置和可重放构建,且仍需以独立行为回归发现被刻意保留在干净输入之外的后门;两项结果均来自有限开放权重和作者评测条件。

新增的MoE 路由权重投毒与负载劫持说明恶意 checkpoint 可只修改路由权重,在私有条件输入下集中专家负载;后续 Capacity Overflow 研究又表明 Vision MoE 可利用批大小触发容量溢出,让深层中和路径在部署批量下失效,作者在 V-MoE、Swin-MoE、ImageNet-100 和 GTSRB 上报告激活态 ASR 76%—87%、休眠态低于 9%。模型签名、router 差分审计、批量条件回归与运行时专家负载监控需要联合使用,这些数字尚无独立复现。

RTLGuard从修复侧研究第三方 RTL 代码生成模型中的投毒后门:先用少量可信规格—RTL 对训练小型教师,再以特征对齐和知识蒸馏指导受污染学生,目标是在降低攻击成功率的同时保留可综合性与功能正确性。该方法不需要完整重训或预先知道触发器,但证据来自作者在有限 RTL 模型和基准上的实验;轻量教师本身的可信来源、干净数据覆盖和未知后门泛化仍需独立验证。

DisarmRAG把模型制品后门扩展到 RAG 检索器:攻击者通过局部模型编辑,使少量目标查询稳定召回抑制生成模型自我纠错的指令与错误上下文,同时让 BEIR 正常检索指标变化小于 1%。它与知识库文档投毒的首个失效控制不同——这里需要攻击者替换 retriever 制品,因此签名、不可变版本和查询特异行为回归是前置控制;作者在多个检索器、3 个问答集与 6 个生成模型上报告目标指令 Recall@k 超过 96%、多种防御提示下 ASR 通常超过 90%,但尚无独立复现或真实供应链事件证据。

ZK-Trace 将可追溯制品扩展到向多个半可信站点分发的专有分类器副本:公开身份标记、接收方特定 Tardos 指纹和零知识凭据分别承担副本归属、泄漏追踪与持有证明。其证书评测在每次调查误指认预算 0.001、无辜行独立等假设下,隔离全部 160 个单所有者副本,并在 720 个双所有者混合副本中追踪 712 个且没有指认无辜方;特征匹配在 20/20 次同架构和 19/20 次跨架构实验中保留标记,GNSS 与 CIFAR-10 副本准确率分别下降 4.8 和 6.1 个百分点。函数级蒸馏会擦除特征标记,蒸馏也会移除权重空间标记,所以该结论只适用于论文的模拟 GNSS 联邦、CIFAR-10、串谋模型及统计/密码学假设,不能把可验证凭据等同于任意派生模型均可追踪。

相关研究文章 ​

参考链接 ​