跳到正文
10月10日 · 周六

全部论文

找到 8 篇

另有 318 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 攻击arXiv 2610.09240

    WebMirage 用对抗图像劫持视觉网页 Agent 的浏览器操作

    提出 WebMirage,用局部对抗图像劫持视觉网页 Agent 的浏览器操作

    发表
    场景
    web agent
    被测模型
    LLaVA-v1.5-13B、LLaVA-v1.6-34B、MiniCPM-o-8B 等 6 个
    摘要论文提出了针对网络智能体的端到端视觉红队框架 WebMirage,揭示了从视觉定位到浏览器执行的安全脆弱性。

    WebMirage 是一个面向视觉定位网络智能体的流水线感知端到端红队攻击框架。

    深度解读完整解读
  2. 攻击arXiv 2610.05793

    研究者训练出按多智能体拓扑触发的代码后门模型

    提出拓扑条件后门,使代码模型在推断多智能体部署时植入漏洞

    发表
    被测模型
    Qwen2.5-7B-Instruct、Qwen2.5-Coder-7B-Instruct

    摘要论文证实了拓扑条件后门的可训练性与泛化性,展示了常规评测盲区,并提出差异化拓扑审计作为检测防御方向。

    深度解读完整解读
  3. 攻击arXiv 2609.39788

    研究:多智能体系统潜在通信链路可被训练用于提升有害顺从

    提出只训练或篡改多智能体潜在通信链路来提高有害遵从

    发表
    被测模型
    Llama-3.2-3B-Instruct、Qwen2.5-3B-Instruct、Gemma-3-1B-IT 等 7 个
    摘要潜在链路本身即可改变冻结智能体系统的安全,奖励既能攻击也能修复。

    学习得到的潜在通信链路会改变由冻结、对齐智能体组成的系统是否遵从有害请求。。作者研究三种拓扑:双智能体、三级顺序协作,以及双专家加汇总。

    深度解读完整解读
  4. 攻击arXiv 2609.22711

    UBA-ORL:针对离线强化学习的遗忘激活后门攻击

    提出 UBA-ORL,以 BD/CM 样本在遗忘后激活离线 RL 后门

    发表
    被测模型
    TD3+BC、BCQ、IQL
    摘要UBA-ORL 用竞争的 BD/CM 样本,使离线 RL 后门在删除伪装轨迹后激活。

    UBA-ORL 研究离线强化学习中由合规轨迹删除激活的后门:合法贡献者同时上传共享触发的后门轨迹和伪装轨迹,训练后触发响应被压低,删除伪装批次后再升高。受害系统是使用静态数据集和轨迹级遗忘接口的离线 RL 服务。对手不能看到训练算法、参数、梯度或具体遗忘算法,但能提交可区分批次,并在部署时向观测注入预定触发。

    深度解读完整解读
  5. 攻击arXiv 2609.22510

    特拉维夫大学提出爆炸性提示词:条件触发的间接提示注入可绕过九款生产 Agent

    提出条件触发的爆炸提示词,并设计摄入期检测器 DeFuse

    发表
    场景
    AI Agent
    被测模型
    Llama-3.1-8B-Instruct、Llama-3.1-70B-Instruct、Qwen2.5-32B-Instruct 等 15 个
    摘要论文揭示了条件触发使提示注入绕过防御并在触发时执行工具,提出轻量检测器并在摄入期有效防范。

    论文针对大语言模型智能体面临的间接提示注入威胁,研究了利用条件句式实现时间分离的爆炸提示词。

    深度解读完整解读
  6. 攻击arXiv 2606.09499

    研究者提出针对世界模型的机器人学习管线投毒攻击

    提出 VPH 与 VTH,只改视频帧劫持世界模型并投毒下游策略

    发表
    被测模型
    Cosmos-Predict 2.5、Cosmos-Predict 2.5 AC、Dino WM 等 4 个
    摘要只改视频帧经世界模型投毒。

    只改看似安全的视频帧,经世界模型之后才改变下游机器人策略。 问题在于世界模型进入数据生成后,数据集检查看到的仍是安全演示,合成轨迹却可以变危险。

    深度解读完整解读
  7. 攻击arXiv 2606.04329

    研究者系统研究 LLM 智能体记忆投毒攻击并提出 MPBench 基准

    系统研究 LLM 智能体记忆投毒并构建基准 MPBench

    发表
    场景
    AI Agent
    被测模型
    Meta-Llama-3.1-70B-Instruct、Deberta-v3-base、Llama-3.1-8B-Instruct 等 5 个

    摘要系统研究了智能体记忆投毒风险,揭示了写入渠道漏洞,构建了 MPBench 基准并指出提示注入防御的局限。

    深度解读完整解读
  8. 攻击arXiv 2604.02623

    论文提出 eTAMP 攻击:网页内容注入可跨会话污染 Web Agent 记忆

    提出 eTAMP,用网页内容跨会话投毒 Web Agent 轨迹记忆并诱导越权操作

    发表
    场景
    web agent
    被测模型
    GPT-5-mini、GPT-5.2、GPT-OSS-120B 等 6 个
    摘要论文提出了基于环境注入的跨任务记忆投毒攻击 eTAMP,作者报告智能体在环境压力下易感性增加且能力与安全并不协同。

    该论文评估了基于大语言模型的 Web 智能体在利用历史交互轨迹进行记忆增强时的安全脆弱性。

    深度解读完整解读
已经到底了