评测与基准arXiv 2610.05818
研究显示 VLA 模型文本护栏漏检隐含危害指令
评测文本守卫与激活探针能否拦住机器人隐含伤害指令
- arXiv
- 2610.05818
- 发表
- 层
- 提示层
- 场景
- 具身与机器人
- 被测模型
- π0.5、OpenVLA-OFT、Llama Guard 3 等 10 个
- 风险Agent 危险操作
- 组件护栏与评审
评测文本守卫与激活探针能否拦住机器人隐含伤害指令
提出 VICS-G 可行未来解码,重排冻结 VLA 策略的动作候选
训练无关解码器 VICS 在冻结 VLA 的推理阶段重排动作块,使当前选择带上该动作仍可能留下的安全完成质量。
提出 SafeStage 基准,分阶段评测视觉语言机器人操作的物理安全
提出 TrojanWorld,用物理触发器对世界模型智能体植入想象引导后门
摘要TrojanWorld 揭示了世界模型智能体的供应链后门风险,通过在世界模型中操纵想象可实现对闭环动作的持续控制。
提出 HazardArena 基准,用孪生场景评测 VLA 的语义安全
HazardArena 评测 VLA 在运动要求不变时,能否因语义风险而停手。