评测与基准arXiv 2610.05818
研究显示 VLA 模型文本护栏漏检隐含危害指令
评测文本守卫与激活探针能否发现 VLA 隐含危害指令
- arXiv
- 2610.05818
- 发表
- 层
- 应用层
- 场景
- 具身与机器人
- 测试
- π0.5、OpenVLA-OFT、Llama Guard 3 等 10 个
评测文本守卫与激活探针能否发现 VLA 隐含危害指令
提出 plan injection 攻击,植入良性伪装计划以绕过思维链监视器
摘要论文指出模型会将外部上下文中的伪装计划改写为自身推理,使思维链监视器失效甚至反向合理化恶意行为。