LGWM:用动作条件世界模型验证 GUI 智能体的屏幕转移
提出 LGWM,用动作条件世界模型核验 GUI 智能体屏幕转移
- arXiv
- 2610.11942
- 发表
- 层
- 应用层
- 场景
- 网页与电脑操作
- 被测模型
- LGWM
提出 LGWM,用动作条件世界模型核验 GUI 智能体屏幕转移
提出利用祖先 VLM 优化对抗补丁,使已部署 VLA 任务失败
开环审计冻结视觉语言安全分,发现其反映场景模板而非危险感知
本文是一项针对安全强化学习中冻结视觉语言模型(VLM)安全评分机制的实证审计研究。
TAPDreamer 用公开编码器做固定补丁。
评测文本守卫与激活探针能否拦住机器人隐含伤害指令
提出 Perturbot 扰动训练,打破 VLA 的模态捷径
Perturbot 是一套不改推理的 VLA 训练期数据干预,用来削弱模态捷径,并用离线分数区分“任务变好”和“靠捷径变好”。
提出条件特征抑制防御,检出对抗补丁后抑制 VLA 内部特征
摘要条件抑制与 patch 相关的 SAE 特征,间歇攻击下可提高 SR,持续攻击下则不能。
审计机器人安全监控的细化缺口,比较表面计划与图细化轨迹的裁决
作者审计 RoboGuard 的一个假设:对高层动作轨迹的安全裁决,在补上语义图诱导的导航和已记录隐式效应之后是否仍然成立。做法是不改验证器,并固定同一条 LTL。
提出 Control OSWorld,评测失准 GUI Agent 的监控
提出 ZoneClaw,用记忆分区防御计算机使用 Agent 的持久记忆攻击
测量并预测具身 VLM 规划器的任务拒答可变性
作者测量 constitution 守护的具身 VLM 规划器:一次拒答在只往场景里放一个日常物体之后还保不保持得住,并把这种易翻转程度称为任务的 malleability。
提出 DrivingBench,评测通用视觉语言模型能否闭环驾驶真车
DrivingBench 评测通用 VLM 能否自己闭环开真车,推理延迟也算进任务。
用 DIBench 评测移动 GUI 智能体被 UI 注入后的决策完整性
摘要论文提出移动智能体决策完整性基准 DIBench,发现欺诈 UI 注入诱导目标选择并推高完成率,通用防御收益不稳定。
证明无显式危害的图文窄微调可诱发跨任务涌现未对齐
论文系统探究了视觉-语言模型中由窄任务微调诱发的跨模态涌现未对齐(Emergent Misalignment, EM)现象。
提出移动 Agent 轨迹审计器 MATE,判断轨迹是否违反可编辑安全策略
MATE 是面向移动 GUI 智能体的轻量策略条件轨迹审计器,在给定自然语言安全策略时判断轨迹是否违规并解释原因。
提出 HazardAuditor,用可执行轨迹训练计算机使用 Agent 的运行时守卫
提出 DURA,用扩散模型生成自然对抗补丁操控 VLA 机器人动作
DURA 是针对 VLA 的扩散式、补丁内容不受限的机器人攻击,同时支持白盒梯度和只看动作输出的黑盒。
提出 S³,用 guard agent 编排阶段安全技能防御智能体多阶段风险
提出 HazardArena 基准,用孪生场景评测 VLA 的语义安全
HazardArena 评测 VLA 在运动要求不变时,能否因语义风险而停手。