防御arXiv 2610.03498
检测与抑制:针对 VLA 模型对抗补丁的机制可解释性防御
提出推理时条件特征抑制,防御 VLA 的视觉对抗补丁
- arXiv
- 2610.03498
- 发表
- 层
- 模型层
- 场景
- 具身与机器人
- 被测模型
- π0.5、SmolVLA
摘要条件抑制与 patch 相关的 SAE 特征,间歇攻击下可提高 SR,持续攻击下则不能。
提出推理时条件特征抑制,防御 VLA 的视觉对抗补丁
摘要条件抑制与 patch 相关的 SAE 特征,间歇攻击下可提高 SR,持续攻击下则不能。
提出 M-CPE 与 X-CPE 两类上下文特权提升攻击
提出 DURA,沿扩散潜空间生成自然对抗补丁,把机器人动作导向指定目标
DURA 是针对 VLA 的扩散式、补丁内容不受限的机器人攻击,同时支持白盒梯度和只看动作输出的黑盒。
评测编码智能体记忆文件中的提示注入及其跨会话持久性
Bad Memory 在沙箱合成工作区里评测文件型持久记忆上的提示注入,比较载荷能否改变当前会话,以及能否在后续会话中留下或叠加。
提出 MMSkillRisk 与 NCVA,评测技能图像隐藏指令诱导的未授权操作
摘要论文提出 MMSkillRisk 基准与 NCVA 攻击,揭示多模态技能中教学图像潜藏指令可引发未授权操作并与良性任务共存。