外观
CrACK:协同视觉基础模型的跨模型接口攻击
摘要
CrACK 研究由 CLIP、SAM、DINO 等冻结视觉基础模型组成的无训练协同流水线。作者没有修改输入像素、模型权重或训练数据,而是在推理时篡改模型之间的特征接口:先反转空间亲和关系,再把预测标签置换到语义距离最远的类别。四种协同流水线在八个分割基准上的结果显示,单个模型的独立输出可以保持不变,但组合结果与下游 LLaVA 推理仍会发生级联错误。
该研究揭示了一种区别于单模型对抗样本的新攻击面:组件各自通过鲁棒性检查,不代表它们传递的中间表示具有端到端语义一致性。证据来自单篇论文的作者实验,没有公开专属代码或独立复现,因此结论限于论文所测接口、数据集和访问权限。
核心创新与差异
原研究贡献。 CrACK 把攻击目标从输入或单个模型内部转向跨模型特征接口,并提出语义—空间对齐依赖:流水线默认相信一个模型生成的空间关系能够直接约束另一个模型的语义特征,却没有验证两者在当前样本上的一致性。
本站分析。 现有多模态鲁棒性研究主要改变图像、语音或提示词。CrACK 的可证伪差分是输入与冻结组件均保持不变,只有组合层的亲和矩阵和标签映射遭到篡改。本文归入 A1.1,因为主要可验证结论是协同模型面对对抗性中间表示时的端到端行为鲁棒性;供应链植入只是获得接口写权限的一种前置路径。
威胁模型与攻击链
攻击者能够修改推理流水线中的轻量聚合代码,但不能修改原始图像、CLIP/SAM/DINO 权重或各模型的前向函数。目标资产是开放词汇分割结果及依赖该结果的视觉问答。最先失效的控制是跨模型接口没有验证中间表示的来源、完整性和语义一致性。
- 协同流水线分别提取语义特征、空间特征和文本标签向量。
- 恶意聚合逻辑用局部语义指导,反转空间亲和关系。
- 聚合结果再经过基于文本嵌入最大距离的标签置换,使输出偏向语义最不相近的类别。
- 被污染的分割结果作为视觉提示传给下游模型,错误随可信接口继续传播。
- 逐组件检查仍看到未修改的原始输出,因而可能漏过组合层故障。
攻击方法与复现材料
下面是本站依据公开机制重构的去武器化接口契约,只验证防护是否拒绝不一致的中间表示,不包含论文的亲和矩阵反转、标签置换或可部署 Hook:
text
input = local_fixture("two-colored-shapes.png")
semantic = frozen_semantic_model(input)
spatial = frozen_spatial_model(input)
candidate = mock_aggregator(semantic, spatial, mode="DRY_RUN_MISMATCH")
assert digest(semantic) == approved_digest("semantic")
assert digest(spatial) == approved_digest("spatial")
assert consistency_score(candidate, semantic, spatial) >= policy.minimum
otherwise quarantine(candidate, reason="cross-model-interface-mismatch")该夹具对应攻击链第 2 至第 4 步。预期检测信号包括聚合前后标签关系突变、空间邻接关系反转、组件输出摘要不变但端到端结果骤降。省略攻击所需的矩阵构造、标签映射和注入位置,避免形成可直接植入真实流水线的实现。
实验设计与实际过程
作者实验覆盖 SCLIP、ProxyCLIP、NACLIP、Trident 四类协同视觉流水线和八个开放词汇分割基准,并比较输入级攻击、单组件行为与组合层攻击。攻击在推理阶段运行,组件权重和输入图像保持不变。论文还把受污染的视觉提示传给 LLaVA,测试错误是否从分割级联到视觉问答。上述内容均属于作者实验;本站只核对论文全文,未运行攻击或下游模型。
关键结果与实际影响
- 在四种流水线、八个分割基准中,作者报告 CrACK 均造成显著性能下降,而每个冻结组件的独立输出不变;逐模型验收无法覆盖组合接口。
- 两个阶段承担不同作用:亲和关系矛盾破坏空间聚合,语义置换控制错误类别。单独移除任一阶段都会改变攻击效果。
- 污染可继续影响 LLaVA 的问答结果,说明结构化中间表示也可能成为下游模型信任的输入。
- 影响成立的前提是攻击者已经取得聚合层代码或运行时写权限。论文没有证明普通 API 用户能完成同类篡改。
防护措施与验证方法
部署方应把聚合代码、模型版本、标签集合和接口变换一并纳入签名与测量启动,不能只校验基础模型文件。接口层可记录输入输出摘要、亲和矩阵统计量和标签映射版本,并以独立实现复算少量样本。
端到端验收应加入组件不变但接口受扰的阴性与阳性对照。可测指标包括分割性能变化、跨模型一致性分数、下游任务错误率、误报率和额外延迟。检测器还应面对了解阈值的自适应对手。
局限与待验证问题
论文没有公开专属代码,证据尚无独立复现。实验集中在开放词汇分割和一个下游视觉问答链,不能外推到所有多模态系统。攻击要求修改聚合层,现实可达性取决于代码供应链、插件机制和运行时权限。
未来需要验证签名、远程证明和语义一致性检测能否同时发现恶意接口与正常版本漂移,并量化其在大型流水线中的性能代价。