跳到正文
10月10日 · 周六

全部论文

找到 22 篇

另有 241 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 攻击arXiv 2610.09240

    WebMirage 用对抗图像劫持视觉网页 Agent 的浏览器操作

    提出 WebMirage,用局部对抗图像劫持视觉网页 Agent 的浏览器操作

    发表
    场景
    web agent
    被测模型
    LLaVA-v1.5-13B、LLaVA-v1.6-34B、MiniCPM-o-8B 等 6 个
    摘要论文提出了针对网络智能体的端到端视觉红队框架 WebMirage,揭示了从视觉定位到浏览器执行的安全脆弱性。

    WebMirage 是一个面向视觉定位网络智能体的流水线感知端到端红队攻击框架。

    深度解读完整解读
  2. 攻击arXiv 2610.06083

    研究者提出面向深度强化学习的轨迹级可迁移黑盒对抗攻击

    提出轨迹级可迁移对抗攻击,降低深度强化学习策略的期望回报

    发表
    被测模型
    DQN、Double DQN (DDQN)
    摘要轨迹级后退视界攻击在 CartPole 上比逐步 FGSM 类和 Sign 噪声更压低回报。

    这项工作研究 DRL 上的迁移式黑盒观测攻击:受害参数不可访问时,在白盒代理上造扰动再迁移。

    深度解读完整解读
  3. 攻击arXiv 2609.35912

    MMSkillRisk:多模态技能图像中的隐藏指令可诱导 Agent 执行未授权操作

    提出 MMSkillRisk 基准,评测多模态技能图像中的隐藏指令诱导 Agent 越权操作

    发表
    被测模型
    GPT-5.6-sol、Kimi-K2.6、Kimi-K3 等 6 个

    摘要论文提出 MMSkillRisk 基准与 NCVA 攻击,揭示多模态技能中教学图像潜藏指令可引发未授权操作并与良性任务共存。

    深度解读完整解读
  4. 攻击arXiv 2609.33628

    用课程强化学习对前沿模型做提示注入红队测试

    用跨目标课程强化学习训练提示注入红队,攻破前沿智能体

    发表
    场景
    AI Agent
    被测模型
    GPT-4o-mini、GPT-5-nano、GPT-5.6-Luna 等 12 个
    摘要提出跨目标模型课程强化学习,攻破前沿模型冷启动瓶颈并实现跨模型迁移。

    该研究针对强化学习自动化提示注入红队在攻击前沿大模型时的冷启动问题,提出了一种基于目标模型鲁棒性递进的课程强化学习方法。

    深度解读完整解读
  5. 攻击arXiv 2609.22510

    特拉维夫大学提出爆炸性提示词:条件触发的间接提示注入可绕过九款生产 Agent

    提出条件触发的爆炸提示词,并设计摄入期检测器 DeFuse

    发表
    场景
    AI Agent
    被测模型
    Llama-3.1-8B-Instruct、Llama-3.1-70B-Instruct、Qwen2.5-32B-Instruct 等 15 个
    摘要论文揭示了条件触发使提示注入绕过防御并在触发时执行工具,提出轻量检测器并在摄入期有效防范。

    论文针对大语言模型智能体面临的间接提示注入威胁,研究了利用条件句式实现时间分离的爆炸提示词。

    深度解读完整解读
  6. 攻击arXiv 2609.13889

    PMPA:针对 OpenClaw 与 Claude Code 的持久记忆投毒攻击

    提出 PMPA,经外部源向 Agent 持久记忆投毒并跨会话泄露隐私

    发表
    被测模型
    DeepSeek-V4-Flash、DeepSeek-V4-Pro、Qwen3-Max

    摘要论文提出了持久记忆投毒攻击 PMPA,报告了 harness 智能体在处理外部数据时易受跨会话记忆投毒与隐私泄露的风险。

    深度解读完整解读
  7. 攻击arXiv 2609.07051

    TrojanWorld:通过想象引导对世界模型智能体植入后门

    提出 TrojanWorld,用物理触发器对世界模型智能体植入想象引导后门

    发表
    被测模型
    TD-MPC2、DreamerV3、R2-Dreamer

    摘要TrojanWorld 揭示了世界模型智能体的供应链后门风险,通过在世界模型中操纵想象可实现对闭环动作的持续控制。

    深度解读完整解读
  8. 攻击arXiv 2609.04533

    Repeat-After-Me:针对黑盒 VLM 的自适应视觉提示注入攻击

    提出 Repeat-After-Me 自适应视觉提示注入,诱导 VLM 智能体执行指定任务

    发表
    场景
    AI Agent
    被测模型
    Claude-Opus-4.7、GPT-5.5、Gemini-3.1-Pro 等 6 个

    摘要论文提出了针对黑盒 VLM 的前缀诱导自适应视觉提示注入,在多款模型上诱发了工具调用与隐私泄露。

    深度解读完整解读
  9. 攻击arXiv 2608.10393

    DURA:用扩散模型生成自然对抗补丁攻击 VLA 机器人模型

    提出 DURA,用扩散模型生成自然对抗补丁操控 VLA 机器人动作

    发表
    被测模型
    OpenVLA-7B、π0-FAST、openvla-7B
    摘要DURA 用扩散潜空间轨迹生成自然补丁,白盒与黑盒都能把 VLA 导向指定动作。

    DURA 是针对 VLA 的扩散式、补丁内容不受限的机器人攻击,同时支持白盒梯度和只看动作输出的黑盒。

    深度解读完整解读
  10. 攻击arXiv 2608.04741

    LoginTrap:针对 LLM Web Agent 的任务无关钓鱼式间接提示注入攻击

    提出 LoginTrap,以网页弹窗诱导 Web Agent 提交敏感信息

    发表
    场景
    web agent
    被测模型
    GPT-4o、Gemini 3 Flash、Claude Sonnet 4 等 7 个

    摘要揭示网络智能体在黑盒网页下的登录诱导风险,利用模糊测试生成话术并跨骨干和架构验证了隐私泄露威胁。

    深度解读完整解读
  11. 攻击arXiv 2608.04565

    研究者提出 Breadcrumbing 长程攻击,可劫持 DeepResearch 类搜索 Agent 的证据链

    提出权威链劫持与轨迹引导策略演化,劫持搜索 Agent 的证据链

    发表
    场景
    web agent
    被测模型
    Qwen3.5-9B、Gemma4-31B、DeepResearch 等 7 个

    摘要论文揭示了多步搜索智能体在受限中间人操纵下的脆弱性,提出 ACH 策略与 TGSE 演化方法并完成系统验证。

    深度解读完整解读
  12. 攻击arXiv 2608.00718

    研究揭示多智能体 LLM 流水线的结构性漏洞

    提出多智能体流水线的边界攻击,使对抗内容作为可信输入跨层传播

    发表
    被测模型
    GPT-5-mini、Claude Sonnet 4.5、Kimi K2.5
    摘要缺边界校验使对抗内容跨智能体传播,作者称这是架构属性而非模型能力。

    作者把多智能体 LLM 流水线的对抗问题定义为缺少边界校验,并用生产轨迹和受控实验检查脆弱性来自架构还是骨干模型。中间输出未经验证就传给下游。作者认为,一旦某级接受对抗内容,后续智能体会把它当作可信输入。

    深度解读完整解读
  13. 攻击arXiv 2606.09499

    研究者提出针对世界模型的机器人学习管线投毒攻击

    提出 VPH 与 VTH,只改视频帧劫持世界模型并投毒下游策略

    发表
    被测模型
    Cosmos-Predict 2.5、Cosmos-Predict 2.5 AC、Dino WM 等 4 个
    摘要只改视频帧经世界模型投毒。

    只改看似安全的视频帧,经世界模型之后才改变下游机器人策略。 问题在于世界模型进入数据生成后,数据集检查看到的仍是安全演示,合成轨迹却可以变危险。

    深度解读完整解读
  14. 攻击arXiv 2606.04329

    研究者系统研究 LLM 智能体记忆投毒攻击并提出 MPBench 基准

    系统研究 LLM 智能体记忆投毒并构建基准 MPBench

    发表
    场景
    AI Agent
    被测模型
    Meta-Llama-3.1-70B-Instruct、Deberta-v3-base、Llama-3.1-8B-Instruct 等 5 个

    摘要系统研究了智能体记忆投毒风险,揭示了写入渠道漏洞,构建了 MPBench 基准并指出提示注入防御的局限。

    深度解读完整解读
  15. 攻击arXiv 2605.08310

    WebTrap:针对浏览器 Agent 导航过程的中途劫持注入攻击

    提出 WebTrap 三阶段陷阱,中途劫持浏览器 Agent 完成攻击后再返回用户任务

    发表
    场景
    web agent
    被测模型
    DeepSeek-V3.1-Terminus、Gemini-2.5-Flash、GLM-4.5-Air 等 5 个
    摘要WebTrap 把攻击目标嵌进用户流程中途执行再返回。

    WebTrap 是针对长程网页与文件导航的中途劫持注入,目标是在完成攻击动作后仍回到用户任务。

    深度解读完整解读
  16. 攻击arXiv 2604.02623

    论文提出 eTAMP 攻击:网页内容注入可跨会话污染 Web Agent 记忆

    提出 eTAMP,用网页内容跨会话投毒 Web Agent 轨迹记忆并诱导越权操作

    发表
    场景
    web agent
    被测模型
    GPT-5-mini、GPT-5.2、GPT-OSS-120B 等 6 个
    摘要论文提出了基于环境注入的跨任务记忆投毒攻击 eTAMP,作者报告智能体在环境压力下易感性增加且能力与安全并不协同。

    该论文评估了基于大语言模型的 Web 智能体在利用历史交互轨迹进行记忆增强时的安全脆弱性。

    深度解读完整解读