跳到正文
10月10日 · 周六

全部论文

找到 8 篇
筛选5
同一类里任选其一,不同类之间同时满足;数字是加上其他已选条件后的篇数。另有 201 篇还没打标签,不在筛选结果里。

另有 201 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 评测与基准arXiv 2610.06898

    DIBench:面向移动 GUI 智能体多候选选择决策完整性的安全基准

    用 DIBench 评测移动 GUI 智能体被 UI 注入后的决策完整性

    发表
    被测模型
    Qwen2.5-VL(32B)、Qwen3-VL(32B)、GUI-Owl(32B) 等 7 个

    摘要论文提出移动智能体决策完整性基准 DIBench,发现欺诈 UI 注入诱导目标选择并推高完成率,通用防御收益不稳定。

    深度解读完整解读
  2. 评测与基准arXiv 2609.19140

    AgentLSD:在对抗性任务污染下评测 AI 安全 Agent

    评测安全 Agent 在对抗性任务污染下的解题成功与开销

    发表
    场景
    web agent
    被测模型
    Gemma-4 31B、DeepSeek-V4 Flash、GPT-OSS 120B 等 6 个
    摘要AgentLSD 用配对 web CTF 表明,欺骗性环境证据会改变安全智能体的解题率与工作量。

    AgentLSD 是一个对照框架,用来测量安全智能体在任务本身不变时,对对抗性任务污染的反应。

    深度解读完整解读
  3. 评测与基准arXiv 2512.23128

    牛津等发布 TRAP 基准

    构建 TRAP 基准,评测网页 Agent 被界面提示注入劫持任务的情况

    发表
    场景
    web agent
    被测模型
    GPT-5、Claude Sonnet 3.7、Gemini 2.5 Flash 等 6 个
    摘要论文提出了基于五维模块化攻击空间的 TRAP 基准,评估了六个模型在真实网页环境中的注入风险。

    研究定位:针对网页自主智能体易受外部界面提示注入攻击的问题,构建了基于真实网站克隆的模块化评测基准 TRAP。

    深度解读完整解读
  4. 评测与基准arXiv 2510.27140

    MobiRed 框架测评八款移动 LLM Agent 的第三方渠道提示注入攻击

    用 MobiRed 评测移动 LLM Agent 面对第三方渠道的提示注入

    发表
    被测模型
    Mobile-Agent-E、AppAgent、AutoGLM 等 8 个

    摘要论文评估了移动 LLM 智能体作为 confused deputy 的易受攻击性,作者称非应用控制通道可诱导智能体执行多步越权危害。

    深度解读完整解读
  5. 评测与基准arXiv 2406.12814

    论文提出 ARE 框架,在 VisualWebArena 上评估多模态 Agent 的对抗鲁棒性

    提出 ARE 框架与图像文本攻击,评测多模态网页 Agent 的对抗鲁棒性

    发表
    场景
    web agent
    被测模型
    GPT-4o、GPT-4V、Claude-3-Opus 等 4 个

    摘要系统评估多模态网页智能体的脆弱性,指出推理时计算组件被攻破会加剧系统风险。

    深度解读完整解读
已经到底了