外观
UniTexture:视觉—语言—动作模型的通用对抗纹理
摘要
UniTexture 优化一张可贴到三维物体表面的纹理,使视觉—语言—动作模型(VLA)在多个任务中产生攻击者指定动作。研究覆盖不同任务套件并迁移到两类 VLA 模型,区别于只对单个视角或单一任务生效的传统贴片。
结果来自作者控制的白盒或迁移实验。它证明模型感知到动作映射存在可利用脆弱性,但不能直接外推到任意真实机器人、相机和光照环境。
核心创新与差异
原研究贡献是利用可微渲染把同一纹理跨视角、跨任务优化。本站将首个失效控制定位为模型视觉表征对表面纹理的非稳健依赖,而不是机器人运行时权限控制。
威胁模型与攻击链
攻击者能够控制目标物体表面外观,但不能修改模型、任务指令或机器人软件。攻击链为:
- 收集或近似目标任务的相机视角和动作目标。
- 优化一张共享纹理,使多个视角下的模型动作偏向目标。
- 将纹理映射到物体表面。
- VLA 感知纹理后输出错误或攻击者指定动作。
攻击方法与复现材料
以下为本站依据公开机制重构的去武器化流程,只用于本地仿真:
text
for view in simulated_views:
image = render(test_object, texture, view)
action = vla(image, benign_instruction)
loss += distance(action, harmless_test_target)
update(texture, gradient(loss))复现应使用仿真物体和无害动作目标,不连接真实机器人执行器。检测信号包括跨视角动作异常、纹理扰动集中和感知表征坍塌。
实验设计与实际过程
作者在多任务环境中优化统一纹理,并比较单任务贴片、随机纹理和干净物体;随后测试跨模型迁移。本站未执行实体复现。
关键结果与实际影响
研究显示一个表面纹理可以同时影响多类任务,并迁移到不同 VLA。实际影响取决于攻击者能否控制物体、是否能接近训练视角以及系统是否有动作安全约束。
防护措施与验证方法
防护应组合纹理随机化、多视角一致性检测、深度或触觉交叉验证和动作级安全包络。验证必须包含实体光照、相机变化和自适应纹理,而不能只测试固定贴片。
局限与待验证问题
主要证据来自仿真和作者模型,真实打印、材质反射与闭环机器人结果仍不足。公开结论不证明所有 VLA 都存在同等攻击成功率。