评测与基准arXiv 2610.05818
研究显示 VLA 模型文本护栏漏检隐含危害指令
评测文本守卫与激活探针能否发现 VLA 隐含危害指令
- arXiv
- 2610.05818
- 发表
- 层
- 应用层
- 场景
- 具身与机器人
- 被测模型
- π0.5、OpenVLA-OFT、Llama Guard 3 等 10 个
评测文本守卫与激活探针能否发现 VLA 隐含危害指令
提出 ClawSentry 渐进式多层监控网关,拦截恶意技能包与上下文注入
ClawSentry 是挂在智能体运行时之外的安全监督网关,用来同时盖住 skill 执行的多个生命周期边界,并把已被拒绝的效果记到会话里。
构建 ACE 语料并比较内核与应用层证据的攻击检测效果
ACE 是一份把智能体会话的内核 syscall 痕迹与应用层清单、转录配对起来的检测语料和基准。。
提出策略条件轨迹审计器 MATE,判断移动 Agent 是否违反可编辑安全策略
MATE 是面向移动 GUI 智能体的轻量策略条件轨迹审计器,在给定自然语言安全策略时判断轨迹是否违规并解释原因。