防御arXiv 2610.03498
检测与抑制:针对 VLA 模型对抗补丁的机制可解释性防御
提出条件特征抑制防御,检出对抗补丁后抑制 VLA 内部特征
- arXiv
- 2610.03498
- 发表
- 层
- 模型层
- 场景
- 具身与机器人
- 被测模型
- π0.5、SmolVLA
摘要条件抑制与 patch 相关的 SAE 特征,间歇攻击下可提高 SR,持续攻击下则不能。
提出条件特征抑制防御,检出对抗补丁后抑制 VLA 内部特征
摘要条件抑制与 patch 相关的 SAE 特征,间歇攻击下可提高 SR,持续攻击下则不能。
提出 INTENT-AS-A-TOOL,用意图工具概率跟踪并干预智能体失准
Zhang 等人研究推理型语言模型在职场邮件沙箱里如何走向智能体失准,并提出用动作偏好而不是事后文本标签来跟踪承诺。问题是:有害执行往往出现在推理已经形成意图之后,但 CoT 监控是事后、粗粒度、依赖外部评审的,也看不到模型倾向调用哪个动作。