防御arXiv 2610.03498
检测与抑制:针对 VLA 模型对抗补丁的机制可解释性防御
提出条件特征抑制防御,检出对抗补丁后抑制 VLA 内部特征
- arXiv
- 2610.03498
- 发表
- 层
- 模型层
- 场景
- 具身与机器人
- 被测模型
- π0.5、SmolVLA
摘要条件抑制与 patch 相关的 SAE 特征,间歇攻击下可提高 SR,持续攻击下则不能。
提出条件特征抑制防御,检出对抗补丁后抑制 VLA 内部特征
摘要条件抑制与 patch 相关的 SAE 特征,间歇攻击下可提高 SR,持续攻击下则不能。
提出 ZoneClaw,用记忆分区防御计算机使用 Agent 的持久记忆攻击
用 DIBench 评测移动 GUI 智能体被 UI 注入后的决策完整性
摘要论文提出移动智能体决策完整性基准 DIBench,发现欺诈 UI 注入诱导目标选择并推高完成率,通用防御收益不稳定。
提出 SYNCHAIN,诱导计算机使用 Agent 自建跨任务持久攻击链
摘要论文揭示了 CUA 自合成工件带来的内部供应链威胁,验证了潜伏载荷的跨任务传播能力与防御局限。
提出 S³,用 guard agent 编排阶段安全技能防御智能体多阶段风险