评测与基准arXiv 2610.05818
研究显示 VLA 模型文本护栏漏检隐含危害指令
评测文本守卫与激活探针能否拦住机器人隐含伤害指令
- arXiv
- 2610.05818
- 发表
- 层
- 提示层
- 场景
- 具身与机器人
- 被测模型
- π0.5、OpenVLA-OFT、Llama Guard 3 等 10 个
- 风险Agent 危险操作
- 组件护栏与评审
评测文本守卫与激活探针能否拦住机器人隐含伤害指令
提出 ZoneClaw,用记忆分区防御计算机使用 Agent 的持久记忆攻击
提出移动 Agent 轨迹审计器 MATE,判断轨迹是否违反可编辑安全策略
MATE 是面向移动 GUI 智能体的轻量策略条件轨迹审计器,在给定自然语言安全策略时判断轨迹是否违规并解释原因。
提出 HazardAuditor,用可执行轨迹训练计算机使用 Agent 的运行时守卫
提出 S³,用 guard agent 编排阶段安全技能防御智能体多阶段风险