评测与基准arXiv 2610.11942
LGWM:用动作条件世界模型验证 GUI 智能体的屏幕转移
提出 LGWM,用动作条件世界模型核验 GUI 智能体屏幕转移
- arXiv
- 2610.11942
- 发表
- 层
- 应用层
- 场景
- 网页与电脑操作
- 被测模型
- LGWM
提出 LGWM,用动作条件世界模型核验 GUI 智能体屏幕转移
提出 CredLeak-Bench,评测 Agent 面对钓鱼的凭据泄露与恢复
用 DIBench 评测移动 GUI 智能体被 UI 注入后的决策完整性
摘要论文提出移动智能体决策完整性基准 DIBench,发现欺诈 UI 注入诱导目标选择并推高完成率,通用防御收益不稳定。
评测安全 Agent 在对抗性任务污染下的解题成功与开销
AgentLSD 是一个对照框架,用来测量安全智能体在任务本身不变时,对对抗性任务污染的反应。
构建 TRAP 基准,评测网页 Agent 被界面提示注入劫持任务的情况
研究定位:针对网页自主智能体易受外部界面提示注入攻击的问题,构建了基于真实网站克隆的模块化评测基准 TRAP。
用 MobiRed 评测移动 LLM Agent 面对第三方渠道的提示注入
摘要论文评估了移动 LLM 智能体作为 confused deputy 的易受攻击性,作者称非应用控制通道可诱导智能体执行多步越权危害。
提出网页 Agent 提示注入基准 WASP 并端到端评测安全性
摘要论文提出针对网络智能体的端到端注入评测基准 WASP,作者称智能体易偏离目标但难以完成复杂攻击。
提出 ARE 框架与图像文本攻击,评测多模态网页 Agent 的对抗鲁棒性
摘要系统评估多模态网页智能体的脆弱性,指出推理时计算组件被攻破会加剧系统风险。