外观
输出回灌式黑盒 LLM 后门检测
摘要
Self-feeding 检测把模型本轮输出作为下一轮输入,使文本逐渐靠近微调数据分布,从而在不知道触发词、训练数据或干净权重时暴露后门。作者在 6 个开放权重模型、11 类后门、20 个普通起始提示和最长 10 步链上评估。
方法在 5/6 个模型上发现后门,汇总精确率为 92.0%;单提示召回率只有 19.2%,并产生两个固定提示基线没有的误报。因此它适合作为廉价初筛,不是后门不存在的证明。
方法的独特价值
与重复同一提示相比,输出回灌主动探索模型自身生成分布。方法只需要文本查询和恶意输出识别器,不要求访问权重。
适用范围
适合下载模型部署前的黑盒筛查。闭源 API、难以识别的隐蔽目标和对自回灌专门训练的后门可能逃逸。
方法与实施流程
从笑话、算术、食谱等普通提示开始,连续将输出回灌最多十步;识别每步是否出现预定义恶意行为。使用多起始提示聚合到模型级判定,并与同提示重复基线比较。
质量控制
必须同时报告 prompt-level 和 model-level 指标、链长度、查询成本和误报。检测器本身应由人工样本校准,不能让同一个 LLM 同时生成和裁决。
局限与待验证问题
一个模型从未被触发,说明阴性结果不可靠。实验模型和后门由作者构造,尚需第三方真实模型盲测。