跳到正文
10月9日 · 周五

全部论文

找到 13 篇

另有 700 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 攻击arXiv 2608.04741

    LoginTrap:针对 LLM Web Agent 的任务无关钓鱼式间接提示注入攻击

    提出 LoginTrap,用网页弹窗实施任务无关钓鱼式间接提示注入并窃取敏感信息

    发表
    测试
    GPT-4o、Gemini 3 Flash、Claude Sonnet 4 等 7 个

    摘要揭示网络智能体在黑盒网页下的登录诱导风险,利用模糊测试生成话术并跨骨干和架构验证了隐私泄露威胁。

    深度解读完整解读
  2. 攻击arXiv 2604.02623

    论文提出 eTAMP 攻击:网页内容注入可跨会话污染 Web Agent 记忆

    提出 eTAMP,通过网页注入跨会话污染 Web 智能体轨迹记忆

    发表
    测试
    GPT-5-mini、GPT-5.2、GPT-OSS-120B 等 7 个
    摘要论文提出了基于环境注入的跨任务记忆投毒攻击 eTAMP,作者报告智能体在环境压力下易感性增加且能力与安全并不协同。

    该论文评估了基于大语言模型的 Web 智能体在利用历史交互轨迹进行记忆增强时的安全脆弱性。

    深度解读完整解读
  3. 攻击arXiv 2610.09240

    WebMirage 用对抗图像劫持视觉网页 Agent 的浏览器操作

    提出 WebMirage,用对抗图像劫持视觉网页智能体的浏览器操作

    发表
    测试
    LLaVA-v1.5-13B、LLaVA-v1.6-34B、MiniCPM-o-8B 等 6 个
    摘要论文提出了针对网络智能体的端到端视觉红队框架 WebMirage,揭示了从视觉定位到浏览器执行的安全脆弱性。

    WebMirage 是一个面向视觉定位网络智能体的流水线感知端到端红队攻击框架。

    深度解读完整解读
  4. 攻击arXiv 2608.10393

    DURA:用扩散模型生成自然对抗补丁攻击 VLA 机器人模型

    提出 DURA,沿扩散潜空间生成自然对抗补丁,把机器人动作导向指定目标

    发表
    测试
    OpenVLA-7B、π0-FAST、openvla-7B
    摘要DURA 用扩散潜空间轨迹生成自然补丁,白盒与黑盒都能把 VLA 导向指定动作。

    DURA 是针对 VLA 的扩散式、补丁内容不受限的机器人攻击,同时支持白盒梯度和只看动作输出的黑盒。

    深度解读完整解读
  5. 攻击arXiv 2609.04533

    Repeat-After-Me:针对黑盒 VLM 的自适应视觉提示注入攻击

    提出 Repeat-After-Me,以图像前缀诱导智能体调用工具或泄露隐私

    发表
    场景
    AI Agent
    测试
    Claude-Opus-4.7、GPT-5.5、Gemini-3.1-Pro 等 11 个

    摘要论文提出了针对黑盒 VLM 的前缀诱导自适应视觉提示注入,在多款模型上诱发了工具调用与隐私泄露。

    深度解读完整解读
  6. 攻击arXiv 2609.07216

    DIVA:利用视觉锚点对视频生成模型实施多模态越狱

    提出 DIVA,将有害意图拆成视觉锚点与运动文本以越狱视频生成模型

    发表
    攻击者
    黑盒
    测试
    Wan、CogVideoX、LTX-Video 等 9 个
    摘要DIVA 用视觉锚点抑制语义漂移做视频越狱,并给出多条件安全基准 TI2VSafetyBench。

    DIVA 是针对带参考图的视频生成模型的免训练 black-box 越狱:用一致性机制本身堵住语义漂移这条安全逃逸路径。。

    深度解读完整解读
  7. 攻击arXiv 2609.13889

    PMPA:针对 OpenClaw 与 Claude Code 的持久记忆投毒攻击

    提出持久记忆投毒攻击 PMPA,诱导智能体将外部恶意指令写入记忆并跨会话泄露隐私

    发表
    场景
    AI Agent
    测试
    DeepSeek-V4-Flash、DeepSeek-V4-Pro、Qwen3-Max

    摘要论文提出了持久记忆投毒攻击 PMPA,报告了 harness 智能体在处理外部数据时易受跨会话记忆投毒与隐私泄露的风险。

    深度解读完整解读
  8. 攻击arXiv 2609.22510

    特拉维夫大学提出爆炸性提示词:条件触发的间接提示注入可绕过九款生产 Agent

    提出条件触发的爆炸提示词,延迟激活 Agent 的间接提示注入

    发表
    场景
    AI Agent
    测试
    Llama-3.1-8B-Instruct、Llama-3.1-70B-Instruct、Qwen2.5-32B-Instruct 等 14 个
    摘要论文揭示了条件触发使提示注入绕过防御并在触发时执行工具,提出轻量检测器并在摄入期有效防范。

    论文针对大语言模型智能体面临的间接提示注入威胁,研究了利用条件句式实现时间分离的爆炸提示词。

    深度解读完整解读
  9. 攻击arXiv 2609.33628

    用课程强化学习对前沿模型做提示注入红队测试

    提出跨目标课程强化学习,生成间接提示注入以劫持智能体

    发表
    场景
    AI Agent
    测试
    Qwen3-4B-Instruct-2507、GPT-4o-mini、GPT-5-nano 等 14 个
    摘要提出跨目标模型课程强化学习,攻破前沿模型冷启动瓶颈并实现跨模型迁移。

    该研究针对强化学习自动化提示注入红队在攻击前沿大模型时的冷启动问题,提出了一种基于目标模型鲁棒性递进的课程强化学习方法。

    深度解读完整解读
  10. 攻击arXiv 2609.35912

    MMSkillRisk:多模态技能图像中的隐藏指令可诱导 Agent 执行未授权操作

    提出 MMSkillRisk 与 NCVA,评测技能图像隐藏指令诱导的未授权操作

    发表
    测试
    GPT-5.6-sol、Kimi-K2.6、Kimi-K3 等 6 个

    摘要论文提出 MMSkillRisk 基准与 NCVA 攻击,揭示多模态技能中教学图像潜藏指令可引发未授权操作并与良性任务共存。

    深度解读完整解读
已经到底了