LGWM:用动作条件世界模型验证 GUI 智能体的屏幕转移
提出 LGWM,用动作条件世界模型核验 GUI 智能体屏幕转移
- arXiv
- 2610.11942
- 发表
- 层
- 应用层
- 场景
- 网页与电脑操作
- 被测模型
- LGWM
另有 232 篇论文还没打上分类标签,暂不在筛选结果里。
提出 LGWM,用动作条件世界模型核验 GUI 智能体屏幕转移
提出义务识别基准 ObligationBench,并训练护栏识别 Agent 未履行的安全义务
作者认为编码智能体的安全不能只靠拦截禁止动作,还要找出终止时仍未做的安全关键动作,并将其称为义务。
提出 PyCache Trap,用字节码缓存替换绕过 Agent 技能扫描器
这篇论文研究了智能体技能(Agent Skills)安全扫描中的“审查–执行脱节”问题,并提出了对应的攻击验证与防御方案。
提出 Secure-CUA,用动作事务约束计算机使用智能体的不可信影响
Secure-CUA 要限制图形界面里不可信内容对 CUA 决策和 GUI 执行的影响,同时保留合法任务所需的不可信信息。
提出 WebMirage,用局部对抗图像劫持视觉网页 Agent 的浏览器操作
WebMirage 是一个面向视觉定位网络智能体的流水线感知端到端红队攻击框架。
评测编码智能体 harness 安全机制在对抗任务中的防护效果
为 macOS 编程 Agent 构建可用的 microVM 沙箱 SideKernel
提出 COBRA 双 LLM 架构,防御计算机使用 Agent 的分支转向攻击
摘要提出分支转向防御架构 COBRA,通过事前能力约束与边界代理消除分支转向攻击并兼顾效用。
形式化编程 Agent 的审批洗白并提出 HMAC 权能令牌防御
摘要系统揭示编程智能体审批洗白风险,提出七字段权能防御机制,证实其能消除身份时序偏离但难防副作用偏离。
用 DIBench 评测移动 GUI 智能体被 UI 注入后的决策完整性
摘要论文提出移动智能体决策完整性基准 DIBench,发现欺诈 UI 注入诱导目标选择并推高完成率,通用防御收益不稳定。
提出 Tracekit,审计编码 Agent 的意图、推理与动作并检测账本篡改
Tracekit 是无第三方依赖的编码智能体审计层:把人类请求、模型自述和已执行动作并排写入可外部锚定的哈希链,执行前用正则门,事后用规则和独立模型互查。
评测容器、权限规则与沙箱能否区分编译器与编码 Agent 的文件读取
作者在物理流求解器上检查一套编码智能体配置:编译器必须读本组材料与反应模型,这些字节又不得进入模型上下文或离开本机的记录。
证明无显式危害的图文窄微调可诱发跨任务涌现未对齐
论文系统探究了视觉-语言模型中由窄任务微调诱发的跨模态涌现未对齐(Emergent Misalignment, EM)现象。
提出 MMSkillRisk 基准,评测多模态技能图像中的隐藏指令诱导 Agent 越权操作
摘要论文提出 MMSkillRisk 基准与 NCVA 攻击,揭示多模态技能中教学图像潜藏指令可引发未授权操作并与良性任务共存。
提出残余权限重放攻击,跨任务复用长期 Agent 的历史授权绕过确认
提出 SkillDRE,用预执行与运行时双阶段反馈演化恶意 Agent 技能
测试编程智能体被诱导或自主篡改自身执行轨迹的行为
这是一项针对本地大模型智能体执行轨迹完整性与安全防篡改边界的实证研究。
提出可验证操作卡 VAC,把智能体浏览器确认绑定到真实 DOM 操作
提出 CS-Guard 基准,评测代码生成护栏对虚构场景攻击的防御
摘要论文提出了代码安全护栏基准 CS-Guard,评估发现现有护栏对虚构场景攻击和代码级恶意请求防御较弱。
提出 Skill-as-API,隔离多智能体协作中的 skill 正文与系统提示词
Skill-as-API 是面向智能体软件工程的协调协议,用来在跨组织调用时把 skill 的代码和系统提示词留在所有者进程。作者针对三条威胁:经通道或命名空间抽取专有方法,用注入让被调用模型输出系统提示词,以及协作结束后权限继续保留。