评测与基准arXiv 2610.06898
DIBench:面向移动 GUI 智能体多候选选择决策完整性的安全基准
用 DIBench 评测移动 GUI 智能体被 UI 注入后的决策完整性
- arXiv
- 2610.06898
- 发表
- 层
- 应用层
- 场景
- 网页与电脑操作
- 被测模型
- Qwen2.5-VL(32B)、Qwen3-VL(32B)、GUI-Owl(32B) 等 7 个
摘要论文提出移动智能体决策完整性基准 DIBench,发现欺诈 UI 注入诱导目标选择并推高完成率,通用防御收益不稳定。
用 DIBench 评测移动 GUI 智能体被 UI 注入后的决策完整性
摘要论文提出移动智能体决策完整性基准 DIBench,发现欺诈 UI 注入诱导目标选择并推高完成率,通用防御收益不稳定。
构建 ACE 语料,评测内核级证据对 Agent 攻击检测的有效性
ACE 是一份把智能体会话的内核 syscall 痕迹与应用层清单、转录配对起来的检测语料和基准。。
提出企业级检测系统 ADR,识别编程 Agent 的提示注入与恶意 MCP
摘要提出了端点因果遥测、两级在线分流与离线红队闭环的 ADR 系统,并在生产环境中验证了有效性。