评测与基准arXiv 2610.06898
DIBench:面向移动 GUI 智能体多候选选择决策完整性的安全基准
用 DIBench 评测移动 GUI 智能体被 UI 注入后的决策完整性
- arXiv
- 2610.06898
- 发表
- 层
- 应用层
- 场景
- 网页与电脑操作
- 被测模型
- Qwen2.5-VL(32B)、Qwen3-VL(32B)、GUI-Owl(32B) 等 7 个
摘要论文提出移动智能体决策完整性基准 DIBench,发现欺诈 UI 注入诱导目标选择并推高完成率,通用防御收益不稳定。
用 DIBench 评测移动 GUI 智能体被 UI 注入后的决策完整性
摘要论文提出移动智能体决策完整性基准 DIBench,发现欺诈 UI 注入诱导目标选择并推高完成率,通用防御收益不稳定。
提出基准投毒攻击,使自修改编码 Agent 跨代写出含漏洞代码
摘要论文报告了恶意基准能污染自修改代码智能体的进化过程并持续输出漏洞,警示系统设计需纳入安全约束。
提出 READY 框架,认证企业 Agent 在人工监督下能否达到规定可靠性
READY 把“智能体能否自主完成工作”改写成“哪个人机监督策略能在留出证据上达到规定可靠性,以及要付多少运营成本”。。
提出隐蔽后门攻击 AKRASIA,在推理代码模型提示中植入触发器并伪装思维链
摘要论文针对推理代码大模型提出了隐蔽推断期后门攻击 AKRASIA,揭示了模型思维链可被利用进行欺骗性伪装的安全隐患。
提出 AgentRewind,支持长程 Agent 回退对齐检查点并继续执行
用演化算法构造 mind virus 并测量其在多智能体中的传播