评测与基准arXiv 2609.26618
NavSafe-∞:在真实感环境中评测闭环驾驶安全
提出 NAVSAFE-∞ 写真闭环基准,评测端到端驾驶策略的闭环安全
- arXiv
- 2609.26618
- 发表
- 层
- 应用层
- 场景
- 具身与机器人
- 被测模型
- LTF、DiffusionDrive、DrivoR 等 13 个
摘要写真事件级闭环基准显示开环高分不能稳定变成闭环安全。
NAVSAFE-∞ 用写真、事件级闭环仿真检查端到端驾驶策略的安全,而不是只看开环轨迹分数。
提出 NAVSAFE-∞ 写真闭环基准,评测端到端驾驶策略的闭环安全
NAVSAFE-∞ 用写真、事件级闭环仿真检查端到端驾驶策略的安全,而不是只看开环轨迹分数。
提出移动 Agent 轨迹审计器 MATE,判断轨迹是否违反可编辑安全策略
MATE 是面向移动 GUI 智能体的轻量策略条件轨迹审计器,在给定自然语言安全策略时判断轨迹是否违规并解释原因。
提出 HazardAuditor,用可执行轨迹训练计算机使用 Agent 的运行时守卫
提出 ConflictGuard,引导 GUI Agent 在冲突指令下终止执行
ConflictGuard用推理时的可行性核验和条件激活转向,让 GUI 智能体在指令不可行时终止,而不是盲执行。
提出 S³,用 guard agent 编排阶段安全技能防御智能体多阶段风险
提出 LABSHIELD,评测科学实验室智能体的安全推理与规划