跳到正文
10月8日 · 周四

Agent 安全 · 论文

找到 46 篇

另有 378 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 攻击arXiv:2610.09240 ·

    WebMirage 用对抗图像劫持视觉网页 Agent 的浏览器操作

    提出 WebMirage,用对抗图像劫持视觉网页智能体的浏览器操作

    网页与电脑操作测试CogVLM、LLaVA-v1.5-13B、LLaVA-v1.6-34B 等 6 个应用层
    摘要论文提出了针对网络智能体的端到端视觉红队框架 WebMirage,揭示了从视觉定位到浏览器执行的安全脆弱性。

    WebMirage 是一个面向视觉定位网络智能体的流水线感知端到端红队攻击框架。

    完整解读
  2. 分析与理论arXiv:2610.06001 ·

    AgentSpy:在系统调用层观测 AI Agent 行为并检测技能注入攻击

    提出 AgentSpy,在系统调用层观测编程智能体并检测技能注入攻击

    编程 Agent测试glm-5.3-flash、gpt-5.6-terra、deepseek-v4-flash 等 4 个应用层
    摘要提出了系统级智能体监控框架 AgentSpy,揭示出通过测试背后的非预期行为与注入风险。

    本研究提出了面向 AI 智能体的系统级外部监控与行为分析框架 AgentSpy。

    完整解读
  3. 评测与基准arXiv:2610.03938 ·

    论文发现多模态模型启用工具后拒答失败率最高上升 68.7%

    评测启用工具调用后多模态模型拒答有害图文请求的变化

    AI Agent测试GLM-5V-Turbo、Gemini-2.5-Pro、Gemini-3.1-Pro-Preview 等 13 个应用层
    摘要论文揭示了工具调用范式削弱 MLLM 拒答能力的现象,分析了稀释与偏移机制并验证了重注缓解方案。

    论文系统评估了智能体工具调用范式对多模态大语言模型拒答能力的影响,指出了工具增强视觉推理背后的安全隐患。核心探讨的问题在于:当 MLLM 从单次推理转向通过 ReAct 循环调用外部工具(打标、缩放、OCR、代码执行)时,工具使用机制本身是否会降低模型拒答有害请求的概率。

    完整解读
  4. 评测与基准arXiv:2604.02947 ·

    AgentHazard:评估计算机使用智能体有害行为的基准

    提出 AgentHazard 基准,评测计算机使用智能体的执行层有害行为

    网页与电脑操作编程 Agent测试GLM-4.6、Qwen2.5-72B-Instruct、Qwen2.5-Coder-32B-Instruct 等 12 个应用层
    摘要AgentHazard 评估了计算机使用智能体的执行安全,作者认为模型层对齐无法可靠保障智能体层面的安全性。

    AgentHazard 是针对计算机使用智能体执行层安全构建的评估基准,重点探究多步工具调用下局部合理动作累积引发的危害。

    完整解读
  5. 攻击arXiv:2609.39607 ·

    Pretext 攻击绕过 NVIDIA SkillSpector 等 Agent 技能扫描器

    提出 PRETEXT,迭代改写技能文本以绕过扫描并执行木马行为

    编程 Agent攻击者白盒测试glm (z-ai/glm-5.1)、qwen3t (qwen/qwen3-235b-a22b-thinking-2507)、gpt-oss (openai/gpt-oss-120b) 等 4 个应用层
    摘要论文提出了针对多阶段技能检测器的白盒攻击,揭示了单纯依赖大模型自适应检测的局限。

    PRETEXT 是一项针对基于“静态规则加语义大模型”的智能体技能安全检测框架的白盒攻击与协同进化评估研究。

    完整解读
  6. 攻击arXiv:2607.12340 ·

    研究:LLM Agent 技能名幻觉率最高达 62%,可被抢注用于供应链攻击

    提出技能名抢注攻击,利用智能体虚构技能名劫持技能供应链

    编程 Agent测试GLM-4.5-Air、GPT-5.4-mini、Claude Sonnet 4.6 等 10 个应用层
    摘要研究证实智能体虚构技能名具有高发生率与可预测性,现有防御难以兼顾安全与效用,亟需注册表结构性防护。

    本研究系统揭示了大模型智能体技能推荐场景下的虚构技能名称安全风险,将其形式化为一种新型供应链抢注攻击。

    完整解读
  7. 评测与基准arXiv:2608.11469 ·

    SRE-Bench:面向 Agent 逆向工程的无污染真实规模基准

    构建无污染的 SRE-Bench,评测智能体在真实规模二进制上的逆向能力

    编程 Agent测试GLM-5.2、GPT-6-Astra、GPT-5.6-Sol 等 11 个应用层
    摘要SRE-Bench 用从零编写的大规模保护二进制评测智能体 RE,公开设置下多数模型完全解开比例不高。

    作者构建并评测 SRE-Bench,一个从零编写、用于测量智能体逆向工程而非利用开发的基准,并称它同时满足污染控制与真实软件规模。

    完整解读
  8. 其他arXiv:2607.28568 ·

    Frontis-MA1:面向机器学习工程递归自我改进的 AI4AI 模型

    提出 OpenMLE 全栈,用执行反馈后训练机器学习元进化智能体

    编程 Agent测试GLM-5.2、Frontis-MA1-35B、Qwen3.6-35B-A3B 等 15 个训练与数据层
    摘要OpenMLE 训练 Frontis-MA1-35B,用四个共享算子把 MLE 后训练和长程搜索接成元进化闭环。

    作者提出全栈 OpenMLE,在机器学习工程里研究从进化到元进化的一步,并把递归自我改进视为更远目标。智能体要在延迟、有噪声的执行反馈下反复修改程序。作者认为公开系统很少同时提供可扩展环境、基于执行的后训练,以及部署该模型的长程进化搜索。

    完整解读