外观
EviSafe:基于证据的视觉语言模型安全评测
摘要
EviSafe 不只判断视觉语言模型是否拒答,而是同时检查自然响应、文本/视觉证据归因和安全关键证据变化后的行为。EviSafeBench 包含 1,181 个金标准图文场景、2,452 个定向反事实,覆盖八个安全领域和八类风险来源。
作者对十一个模型的实验显示,自然严重度准确率为 27.6%(N=1,069)至 52.8%(N=1,179),宽松诊断一致性为 6.1%(N=1,069)至 29.3%(N=1,032),不安全到安全的反事实转换成功率为 30.4%(N=1,069)至 58.4%(N=1,056)。这里的 N 是各模型成功生成完整输出且得到 GPT-5.4 Judge 记录的原始场景数,并非统一的 1,181。安全外观与正确多模态依据明显分离。
方法的独特价值
结果级评测会把关键词触发拒绝、遗漏视觉危险和良性敏感内容过度拒答混在一起。三探针协议要求模型既作答、又报告证据,并在关键证据被移除或替换时表现出相应变化。
适用范围
基准包含网络/隐私、物理危险、性剥削、健康与自伤、仇恨骚扰、高风险错误信息、欺诈和良性敏感陷阱。它测量可观察的证据一致性,不声称恢复模型内部因果机制。
方法与实施流程
- 从 9,399 条公开记录规范化并筛选场景。
- 标注四级安全决策、文本证据、视觉证据、跨模态关系和响应策略。
- 按风险来源生成一至三个最小反事实变体。
- 分别运行自然响应、证据报告和反事实响应探针。
- 用证据感知 Judge 报告行为、归因与反事实指标,不合成单一总分。
质量控制
最终金标准共 3,633 个图文项,由 1,181 个原始场景和 2,452 个反事实变体组成,其中有 903 张生成式视觉反事实图像。对 Judge 的 200 条分层盲化审计中,自然决策、风险来源和证据字段与人工的一致率分别为 92.5%、88.0% 和 84.3%。
局限与待验证问题
标注和评分部分依赖 GPT-5.4;视觉编辑可能引入伪影,场景也不是最大强度攻击。模型间失败调用数量不同,必须结合每个模型实际 N 解读。后续需做人类复核扩展和真实产品提示配置测试。