Skip to content

UniTexture:视觉—语言—动作模型的通用对抗纹理 ​

摘要 ​

UniTexture 优化一张可贴到三维物体表面的纹理,使视觉—语言—动作模型(VLA)在多个任务中产生攻击者指定动作。研究覆盖不同任务套件并迁移到两类 VLA 模型,区别于只对单个视角或单一任务生效的传统贴片。

结果来自作者控制的白盒或迁移实验。它证明模型感知到动作映射存在可利用脆弱性,但不能直接外推到任意真实机器人、相机和光照环境。

核心创新与差异 ​

原研究贡献是利用可微渲染把同一纹理跨视角、跨任务优化。本站将首个失效控制定位为模型视觉表征对表面纹理的非稳健依赖,而不是机器人运行时权限控制。

威胁模型与攻击链 ​

攻击者能够控制目标物体表面外观,但不能修改模型、任务指令或机器人软件。攻击链为:

  1. 收集或近似目标任务的相机视角和动作目标。
  2. 优化一张共享纹理,使多个视角下的模型动作偏向目标。
  3. 将纹理映射到物体表面。
  4. VLA 感知纹理后输出错误或攻击者指定动作。

攻击方法与复现材料 ​

以下为本站依据公开机制重构的去武器化流程,只用于本地仿真:

text
for view in simulated_views:
    image = render(test_object, texture, view)
    action = vla(image, benign_instruction)
    loss += distance(action, harmless_test_target)
update(texture, gradient(loss))

复现应使用仿真物体和无害动作目标,不连接真实机器人执行器。检测信号包括跨视角动作异常、纹理扰动集中和感知表征坍塌。

实验设计与实际过程 ​

作者在多任务环境中优化统一纹理,并比较单任务贴片、随机纹理和干净物体;随后测试跨模型迁移。本站未执行实体复现。

关键结果与实际影响 ​

研究显示一个表面纹理可以同时影响多类任务,并迁移到不同 VLA。实际影响取决于攻击者能否控制物体、是否能接近训练视角以及系统是否有动作安全约束。

防护措施与验证方法 ​

防护应组合纹理随机化、多视角一致性检测、深度或触觉交叉验证和动作级安全包络。验证必须包含实体光照、相机变化和自适应纹理,而不能只测试固定贴片。

局限与待验证问题 ​

主要证据来自仿真和作者模型,真实打印、材质反射与闭环机器人结果仍不足。公开结论不证明所有 VLA 都存在同等攻击成功率。

参考链接 ​