Skip to content

嵌入相似度安全门的有效性审计 ​

摘要 ​

论文审计用文本嵌入余弦相似度判断“修改是否保持原意”的安全门。一个生产漂移门在 56 个含义破坏变体上捕获 0 个;例如把“停用研究药物”翻转为“使用研究药物”后,相似度仍为 0.9608。

作者构造平衡的语义翻转与词面重叠对照。在 90 个配置、阈值和任务组合中,平衡准确率最高 0.700、中位数 0.525;朴素语料设计甚至会形成反向判别。结果说明高余弦相似度只能描述表征距离,不能单独证明安全语义等价。

评测设计 ​

审计分别控制含义是否改变与词面是否重叠,并比较编码器替换、重叠条件门和自然语言推断。匹配词面重叠后,最强配置的 AUROC 可达 0.79–0.90,但简单修补在留出集只有 0.533 的平衡准确率,自然语言推断也没有稳定胜出。

实施建议 ​

安全门应报告成对反例、类别平衡、阈值敏感性和留出集结果。高风险动作需要结构化字段校验、蕴含/矛盾判断或规则约束,并保留人工复核;余弦分数只宜用作排序信号。

局限与待验证问题 ​

结论针对作者选择的任务、编码器和变体生成流程,不能证明所有嵌入门必然无效。论文发布了工件,但仍需跨语言、跨领域和真实漂移流量复现。

参考链接 ​