跳到正文
10月10日 · 周六

全部论文

找到 4 篇
筛选4
同一类里任选其一,不同类之间同时满足;数字是加上其他已选条件后的篇数。另有 241 篇还没打标签,不在筛选结果里。

另有 241 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 评测与基准arXiv 2610.06898

    DIBench:面向移动 GUI 智能体多候选选择决策完整性的安全基准

    用 DIBench 评测移动 GUI 智能体被 UI 注入后的决策完整性

    发表
    被测模型
    Qwen2.5-VL(32B)、Qwen3-VL(32B)、GUI-Owl(32B) 等 7 个

    摘要论文提出移动智能体决策完整性基准 DIBench,发现欺诈 UI 注入诱导目标选择并推高完成率,通用防御收益不稳定。

    深度解读完整解读
  2. 评测与基准arXiv 2609.28915

    研究提出 ACE 语料库,评估内核级证据对 Agent 安全检测的有效性

    构建 ACE 语料,评测内核级证据对 Agent 攻击检测的有效性

    发表
    被测模型
    AdaBoost、XGBoost、TabPFN 等 10 个
    摘要ACE 用配对的内核与应用层证据表明,syscall 痕迹可判别智能体攻击,两层组合通常更好。

    ACE 是一份把智能体会话的内核 syscall 痕迹与应用层清单、转录配对起来的检测语料和基准。。

    深度解读完整解读
  3. 评测与基准arXiv 2510.27140

    MobiRed 框架测评八款移动 LLM Agent 的第三方渠道提示注入攻击

    用 MobiRed 评测移动 LLM Agent 面对第三方渠道的提示注入

    发表
    被测模型
    Mobile-Agent-E、AppAgent、AutoGLM 等 8 个

    摘要论文评估了移动 LLM 智能体作为 confused deputy 的易受攻击性,作者称非应用控制通道可诱导智能体执行多步越权危害。

    深度解读完整解读
已经到底了