攻击arXiv 2610.06083
研究者提出面向深度强化学习的轨迹级可迁移黑盒对抗攻击
提出轨迹级可迁移对抗攻击,降低深度强化学习策略的期望回报
- arXiv
- 2610.06083
- 发表
- 层
- 模型层
- 场景
- 具身与机器人
- 被测模型
- DQN、Double DQN (DDQN)
- 技术梯度与表征优化
摘要轨迹级后退视界攻击在 CartPole 上比逐步 FGSM 类和 Sign 噪声更压低回报。
这项工作研究 DRL 上的迁移式黑盒观测攻击:受害参数不可访问时,在白盒代理上造扰动再迁移。
提出轨迹级可迁移对抗攻击,降低深度强化学习策略的期望回报
这项工作研究 DRL 上的迁移式黑盒观测攻击:受害参数不可访问时,在白盒代理上造扰动再迁移。
提出条件特征抑制防御,检出对抗补丁后抑制 VLA 内部特征
摘要条件抑制与 patch 相关的 SAE 特征,间歇攻击下可提高 SR,持续攻击下则不能。
提出 MMSkillRisk 基准,评测多模态技能图像中的隐藏指令诱导 Agent 越权操作
摘要论文提出 MMSkillRisk 基准与 NCVA 攻击,揭示多模态技能中教学图像潜藏指令可引发未授权操作并与良性任务共存。
提出 PMPA,经外部源向 Agent 持久记忆投毒并跨会话泄露隐私
摘要论文提出了持久记忆投毒攻击 PMPA,报告了 harness 智能体在处理外部数据时易受跨会话记忆投毒与隐私泄露的风险。