跳到正文
10月9日 · 周五

全部论文

找到 8 篇

另有 516 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 攻击arXiv 2610.09240

    WebMirage 用对抗图像劫持视觉网页 Agent 的浏览器操作

    提出 WebMirage,用对抗图像劫持视觉网页智能体的浏览器操作

    发表
    测试
    LLaVA-v1.5-13B、LLaVA-v1.6-34B、MiniCPM-o-8B 等 6 个
    摘要论文提出了针对网络智能体的端到端视觉红队框架 WebMirage,揭示了从视觉定位到浏览器执行的安全脆弱性。

    WebMirage 是一个面向视觉定位网络智能体的流水线感知端到端红队攻击框架。

    深度解读完整解读
  2. 评测与基准arXiv 2610.06898

    DIBench:面向移动 GUI 智能体多候选选择决策完整性的安全基准

    提出 DIBench,评测界面注入对移动智能体选择决策的操纵

    发表
    测试
    Qwen2.5-VL(32B)、Qwen3-VL(32B)、GUI-Owl(32B) 等 7 个

    摘要论文提出移动智能体决策完整性基准 DIBench,发现欺诈 UI 注入诱导目标选择并推高完成率,通用防御收益不稳定。

    深度解读完整解读
  3. 防御arXiv 2605.17380

    Uber 提出 ADR 企业级 Agent 检测系统,在 7200 台主机部署十个月

    提出企业级检测系统 ADR,检测编程 Agent 的提示注入与恶意 MCP

    发表
    测试
    GPT-4o、Claude Sonnet 4、Llama Guard 3-8B 等 4 个

    摘要提出了端点因果遥测、两级在线分流与离线红队闭环的 ADR 系统,并在生产环境中验证了有效性。

    深度解读完整解读
  4. 防御arXiv 2610.05163

    研究者在 Claude Code 和 Codex 上构造分段提示注入并发布边界动作审计基准

    提出路径对齐归因 PAA,在边界动作前审计长流程智能体的分段提示注入

    发表
    测试
    Claude Code (v2.1.172, Claude Sonnet 5)、Codex CLI (v0.144.0, GPT-5.5)、Claude Sonnet 5 等 7 个
    摘要论文针对长流程注入提出边界动作审计与 PAA,在保持低误阻的同时实现高拦截率。

    本研究针对长流程智能体在执行任务时面临的分阶段间接提示注入威胁,提出了在动作生效前进行拦截的边界动作审计框架与路径对齐归因方法。

    深度解读完整解读
  5. Mind2Web-Injection:面向网页 Agent 视觉提示注入护栏的证据对齐评测

    提出 Mind2Web-Injection,评测网页 Agent 截图护栏的证据对齐

    发表
    测试
    GPT-5.6-luna、Qwen3-VL-32B、Qwen3-VL-8B 等 6 个
    摘要作者称检测、定位和反事实响应在六个 VLM 上可分开。

    Mind2Web-Injection 用来检查网页截图护栏的判决是否对齐到该用的画面证据。。

    深度解读完整解读
  6. 评测与基准arXiv 2609.28915

    研究提出 ACE 语料库,评估内核级证据对 Agent 安全检测的有效性

    构建 ACE 语料并比较内核与应用层证据的攻击检测效果

    发表
    测试
    AdaBoost、XGBoost、TabPFN 等 13 个
    摘要ACE 用配对的内核与应用层证据表明,syscall 痕迹可判别智能体攻击,两层组合通常更好。

    ACE 是一份把智能体会话的内核 syscall 痕迹与应用层清单、转录配对起来的检测语料和基准。。

    深度解读完整解读
  7. 评测与基准arXiv 2609.35912

    MMSkillRisk:多模态技能图像中的隐藏指令可诱导 Agent 执行未授权操作

    提出 MMSkillRisk 与 NCVA,评测技能图像隐藏指令诱导的未授权操作

    发表
    测试
    GPT-5.6-sol、Kimi-K2.6、Kimi-K3 等 6 个

    摘要论文提出 MMSkillRisk 基准与 NCVA 攻击,揭示多模态技能中教学图像潜藏指令可引发未授权操作并与良性任务共存。

    深度解读完整解读
已经到底了