跳到正文
10月8日 · 周四

后门与投毒 · 论文

找到 7 篇

另有 68 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 攻击arXiv:2604.02623 ·

    论文提出 eTAMP 攻击:网页内容注入可跨会话污染 Web Agent 记忆

    提出 eTAMP,通过网页注入跨会话污染 Web 智能体轨迹记忆

    网页与电脑操作测试GPT-5-mini、GPT-5.2、GPT-OSS-120B 等 7 个应用层
    摘要论文提出了基于环境注入的跨任务记忆投毒攻击 eTAMP,作者报告智能体在环境压力下易感性增加且能力与安全并不协同。

    该论文评估了基于大语言模型的 Web 智能体在利用历史交互轨迹进行记忆增强时的安全脆弱性。

    完整解读
  2. 评测与基准arXiv:2609.31342 ·

    研究揭示过期文档投毒:RAG 检索可让模型放弃原本正确的答案

    构建知识逆转基准,评测陈旧检索证据如何推翻模型原本正确的回答

    LLM 应用测试GPT-4o、GPT-4.1、Claude-Opus-4.5 等 13 个应用层
    摘要论文评测了陈旧检索推翻正确知识的中毒现象,并分析了其内部机制与防御局限。

    这篇论文是对检索增强生成(RAG)中“陈旧文档中毒”现象的实证与机理评估研究。

    完整解读
已经到底了