Skip to content

Steering Vector 数据投毒:激活控制包的供应链攻击面 ​

摘要 ​

激活 steering 依赖公开数据集、预计算向量和权重包。本文显示,攻击者替换 steering 数据中约 4%–6% 的 token,即可让最终向量悄然靠近反拒答方向,同时保持正常属性控制看似有效。在两个开放权重模型家族、八个属性组合中,投毒向量的攻击成功率(Attack Success Rate, ASR)比干净参考高 19–51 个百分点。

核心创新与差异 ​

传统模型制品防护主要验证签名和权重完整性,却容易忽略“向量—数据—等价证明”构成的可分发制品链。攻击者不必修改基础模型,只需污染控制数据或预计算向量。

威胁模型与攻击链 ​

攻击者可发布或替换 steering 数据包,并控制白盒模型上的梯度与嵌入邻居查询;用户验证的是干净属性和表面等价证书。首个失效控制是制品来源与内容完整性,影响模型拒答和下游调用安全。

攻击方法与复现材料 ​

本文不提供可用于改变真实模型行为的投毒向量或训练参数。以下为本站依据公开机制重构的合成制品检查,只验证向量来源和行为差分:

text
vector = load_fixture("synthetic-steering-vector", signed=true)
assert verify_provenance(vector)
baseline = evaluate(model, benign_suite, steering=None)
candidate = evaluate(model, benign_suite, steering=vector, sandbox=true)
assert candidate.undeclared_policy_changes == []
record(behavior_delta = candidate - baseline)

夹具对应制品获取、来源验证、加载和行为回归。检测信号是签名或派生关系缺失、特定触发条件下行为突变以及正常能力漂移。省略实际投毒数据、目标方向和可迁移向量。

实验设计与实际过程 ​

作者在两个开放权重家族和八个模型属性上使用各 100 条有害/良性评测提示,并以三模型 Judge 多数投票计算 ASR。实验还测试拒答方向正交化防护;本站未独立复现。

关键结果与实际影响 ​

投毒向量达到 20%–55% 的绝对 ASR,防护可恢复约 82% 的 ASR 差距且不明显损害良性属性。攻击需要白盒访问,不能直接外推到闭源 API;不过开放模型制品仓库的签名不能替代数据内容和生成过程证明。

防护措施与验证方法 ​

锁定 steering 数据、生成脚本和向量摘要,使用可重放构建而非只签最终向量;对拒答方向、良性属性和模型效用做独立测试,并对 bundle 做邻域和表示空间异常检查。

局限与待验证问题 ​

只测到 8B 模型、单一反拒答目标和白盒攻击;跨架构迁移、闭源服务和其他控制目标仍待验证。

参考链接 ​