外观
黑盒多模态护栏的组件归因评测
摘要
端到端拒绝率无法说明究竟是外置护栏还是目标模型自身阻断了请求。论文提出黑盒组件归因方法,在不访问内部权重的前提下,通过输入通道和响应结果分解各组件贡献。
实验组合一个文本护栏、两个开放目标模型,每个条件 100 个提示。图像承载内容时文本护栏拦截 0/100,拒绝完全来自模型;攻击者直接发送文本时,护栏拦截 28–30 次、模型拒绝 34–44 次,护栏贡献约 41%–45%;未编码文本请求中护栏拦截 98 次,模型贡献约 1%,护栏占比约 99%。
评测价值
同一系统的总体阻断率可能掩盖通道盲区。把组件贡献与输入模态配对报告,可以定位应修复的是前置解析、跨模态护栏还是目标模型策略。
实施方法
为每个请求记录模态、护栏决策、是否转发和模型决策;构造语义匹配的文本/图像对照;分别统计覆盖率、条件拒绝率和误伤。新增多模态护栏后,还要在对抗性良性样本上验证可用性,因为作者观察到覆盖提高伴随误伤风险。
局限与待验证问题
结果只覆盖一个护栏和两个模型,黑盒归因依赖可观察的转发/拒绝信号。若服务隐藏中间决策或多组件串联,贡献可能无法唯一识别。