攻击arXiv 2610.09708
研究者提出利用祖先 VLM 的黑盒对抗补丁攻击,可降低 VLA 任务成功率
提出利用祖先 VLM 优化对抗补丁,使已部署 VLA 任务失败
- arXiv
- 2610.09708
- 发表
- 层
- 提示层
- 场景
- 具身与机器人
- 被测模型
- OpenVLA、UniVLA、π0.5
提出利用祖先 VLM 优化对抗补丁,使已部署 VLA 任务失败
提出 PERSISTBD,发布前强化供应链后门使其经良性 SFT 与 RL 后仍外发凭据
本文研究第三方 LLM 智能体在开发者进行良性监督微调(SFT)和强化学习(RL)后训练时的后门持久性风险。
TAPDreamer 用公开编码器做固定补丁。
提出轨迹级可迁移对抗攻击,降低深度强化学习策略的期望回报
这项工作研究 DRL 上的迁移式黑盒观测攻击:受害参数不可访问时,在白盒代理上造扰动再迁移。
提出 PMPA,经外部源向 Agent 持久记忆投毒并跨会话泄露隐私
摘要论文提出了持久记忆投毒攻击 PMPA,报告了 harness 智能体在处理外部数据时易受跨会话记忆投毒与隐私泄露的风险。
提出 TrojanWorld,用物理触发器对世界模型智能体植入想象引导后门
摘要TrojanWorld 揭示了世界模型智能体的供应链后门风险,通过在世界模型中操纵想象可实现对闭环动作的持续控制。
提出针对 Agent Harness 的上下文特权提升攻击
提出 DURA,用扩散模型生成自然对抗补丁操控 VLA 机器人动作
DURA 是针对 VLA 的扩散式、补丁内容不受限的机器人攻击,同时支持白盒梯度和只看动作输出的黑盒。