跳到正文
10月8日 · 周四

Agent 安全 · 论文

找到 22 篇

另有 380 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 攻击arXiv:2604.02623 ·

    论文提出 eTAMP 攻击:网页内容注入可跨会话污染 Web Agent 记忆

    提出 eTAMP,通过网页注入跨会话污染 Web 智能体轨迹记忆

    网页与电脑操作测试GPT-5-mini、GPT-5.2、GPT-OSS-120B 等 7 个应用层
    摘要论文提出了基于环境注入的跨任务记忆投毒攻击 eTAMP,作者报告智能体在环境压力下易感性增加且能力与安全并不协同。

    该论文评估了基于大语言模型的 Web 智能体在利用历史交互轨迹进行记忆增强时的安全脆弱性。

    完整解读
  2. 攻击arXiv:2610.09240 ·

    WebMirage 用对抗图像劫持视觉网页 Agent 的浏览器操作

    提出 WebMirage,用对抗图像劫持视觉网页智能体的浏览器操作

    网页与电脑操作测试LLaVA-v1.5-13B、LLaVA-v1.6-34B、MiniCPM-o-8B 等 6 个应用层
    摘要论文提出了针对网络智能体的端到端视觉红队框架 WebMirage,揭示了从视觉定位到浏览器执行的安全脆弱性。

    WebMirage 是一个面向视觉定位网络智能体的流水线感知端到端红队攻击框架。

    完整解读
  3. 攻击arXiv:2609.39607 ·

    Pretext 攻击绕过 NVIDIA SkillSpector 等 Agent 技能扫描器

    提出 PRETEXT,迭代改写技能文本以绕过扫描并执行木马行为

    编程 Agent攻击者白盒测试glm (z-ai/glm-5.1)、qwen3t (qwen/qwen3-235b-a22b-thinking-2507)、gpt-oss (openai/gpt-oss-120b) 等 4 个应用层
    摘要论文提出了针对多阶段技能检测器的白盒攻击,揭示了单纯依赖大模型自适应检测的局限。

    PRETEXT 是一项针对基于“静态规则加语义大模型”的智能体技能安全检测框架的白盒攻击与协同进化评估研究。

    完整解读
  4. 攻击arXiv:2609.35576 ·

    研究提出跨 LLM 助手的记忆跳跃攻击

    提出跨独立助手的工件介导记忆跳跃自传播攻击

    多智能体测试GPT-5.6 Luna、Kimi-K2.6、GPT-OSS-120B 等 6 个应用层
    摘要论文证实持久工件与内存可形成跨智能体传播链,揭示了将共享工件纳入安全防线的重要意义。

    该论文系统研究并量化了通过共享持久工件在具有独立私有内存的 LLM 智能体之间发生自传播的“工件介导传播”攻击风险。

    完整解读
  5. 攻击arXiv:2610.00430 ·

    Memetic Trojans:利用社交传染在 LLM Agent 网络中传播对抗载荷

    提出 memetic trojans,把对抗载荷嵌入智能体自发转发的社会传染内容

    多智能体测试gpt-oss-120B、deepseek-v4.1-flash、qwen-32B 等 5 个应用层
    摘要memetic trojans 用内生社会传染携带载荷。

    Memetic trojans 是一类网络介导攻击:对抗载荷搭在智能体本来就会转发和点赞的内容上扩散,转发者不必被攻陷,也不必执行“请继续复制”的指令。

    完整解读
  6. 攻击arXiv:2609.22510 ·

    特拉维夫大学提出爆炸性提示词:条件触发的间接提示注入可绕过九款生产 Agent

    提出爆炸提示词,用条件触发的间接注入延迟诱发恶意工具调用

    AI Agent测试Llama-3.1-8B-Instruct、Llama-3.1-70B-Instruct、Qwen2.5-32B-Instruct 等 14 个应用层
    摘要论文揭示了条件触发使提示注入绕过防御并在触发时执行工具,提出轻量检测器并在摄入期有效防范。

    论文针对大语言模型智能体面临的间接提示注入威胁,研究了利用条件句式实现时间分离的爆炸提示词。

    完整解读
  7. 攻击arXiv:2609.33628 ·

    用课程强化学习对前沿模型做提示注入红队测试

    提出跨目标课程强化学习,生成间接提示注入以劫持智能体

    AI Agent测试Qwen3-4B-Instruct-2507、GPT-4o-mini、GPT-5-nano 等 14 个应用层
    摘要提出跨目标模型课程强化学习,攻破前沿模型冷启动瓶颈并实现跨模型迁移。

    该研究针对强化学习自动化提示注入红队在攻击前沿大模型时的冷启动问题,提出了一种基于目标模型鲁棒性递进的课程强化学习方法。

    完整解读