跳到正文
10月8日 · 周四

后门与投毒 · 论文

精选论文 18 篇
  1. 攻击arXiv:2610.09819 · 57

    FAB 攻击:给 HuBERT/WavLM 植入后门,背景警笛声即可让下游语音任务失灵

    作者提出 FAB 攻击,在无预训练数据假设下向声学基础模型植入后门,使 HuBERT 在物理警报声下 ASR 词错误率达 80.71%(Table 2)。

    • 98.4%HuBERT 在 SUPERB ASR 任务上加警报声触发时的 WER(Table 6)
    • 11.4%HuBERT 后门模型在 SUPERB ASR 任务良性输入下的 WER(Table 6)
    • 80.71%HuBERT 在单扬声器物理录音警报声触发下的 ASR WER(Table 2)
    6 问速览在无预训练数据且未知下游任务的弱威胁模型下,如何向声学基础模型注入可物理触发的通用后门。
    1. 这篇论文试图解决什么问题?

      在无预训练数据且未知下游任务的弱威胁模型下,如何向声学基础模型注入可物理触发的通用后门。

    2. 有哪些相关研究?

      论文梳理了传统模型、基础模型及语音领域的后门研究,并对比了 NLP 的 POR 迁移后门基线。

    3. 论文如何解决这个问题?

      FAB 通过重构伪标签维持良性掩码预测损失,并用余弦距离将中间层特征映射至全 1 向量以破坏触发输入表征。

    4. 论文做了哪些实验?

      论文在 HuBERT 和 WavLM 上评测了 9 项任务、物理场景及防御,触发器导致多任务性能出现明显下降。

    5. 有什么可以进一步探索的点?

      作者指出过度微调防御开销大且适用受限,对 POR 的理论分析留待未来;实验未覆盖大尺寸模型及多语言。

    6. 总结一下论文的主要内容

      论文提出了针对声学基模的 FAB 后门攻击,在弱威胁模型下实现了任务无关、物理可触发的后门植入。

    完整解读
  2. 攻击arXiv:2604.02623 · 56

    论文提出 eTAMP 攻击:网页内容注入可跨会话污染 Web Agent 记忆

    作者通过网页向 Web 智能体注入带条件的轨迹记忆,在 GPT-5-mini 上挫败感利用与混沌结合时 ASRB 达 32.5%。

    • 32.5%GPT-5-mini在挫败感利用与混沌工程下的ASRB(Table 1)
    • 23.4%GPT-5.2在挫败感利用与混沌工程下的ASRB(Table 1)
    • 22.3%GPT-5.2在权威框架策略无混沌下的ASRB(Table 1)
    6 问速览作者研究基于原始轨迹记忆的 Web 智能体在无需直接访问存储时遭受跨会话、跨网站环境注入记忆投毒攻击的风险。
    1. 这篇论文试图解决什么问题?

      作者研究基于原始轨迹记忆的 Web 智能体在无需直接访问存储时遭受跨会话、跨网站环境注入记忆投毒攻击的风险。

    2. 有哪些相关研究?

      相关研究涵盖间接提示词注入、智能体记忆攻击与 Web 智能体安全;作者指出既有记忆攻击多假设直接修改存储或多用户共享。

    3. 论文如何解决这个问题?

      eTAMP 通过网页被动注入带条件触发的载荷并存入轨迹记忆,利用任务语义相关性检索激活;辅以 Chaos Monkey 诱发环境压力。

    4. 论文做了哪些实验?

      eTAMP 在 GPT-5-mini 和 GPT-5.2 上分别取得最高 32.5% 和 23.4% 的 ASRB;混沌压力使部分模型易感性增加数倍。

    5. 有什么可以进一步探索的点?

      作者指出了仅研究原始轨迹记忆、未系统评估主动防御、召回测试仅用单一提示词等局限与后续方向。

    6. 总结一下论文的主要内容

      论文提出了基于环境注入的跨任务记忆投毒攻击 eTAMP,作者报告智能体在环境压力下易感性增加且能力与安全并不协同。

    完整解读
  3. 攻击arXiv:2610.07723 · 57

    研究者提出答案侧后门:让模型自生成触发词绕过安全拒答

    在四款开源LLM上,5%投毒率下回答端后门使Mistral和Gemma的ASR达100.00%,并穿透主流输入防御。

    • 100.00%Mistral在5%投毒率下的ASR(据Table 2)
    • 100.00%Gemma在5%投毒率下的ASR(据Table 2)
    • 93.75%LLaMA2在5%投毒率下的ASR(据Table 2)
    6 问速览论文指出当前多轮大模型后门防御聚焦于输入端清洗,忽视了模型历史回复中自生成触发词绕过安全拒绝的风险。
    1. 这篇论文试图解决什么问题?

      论文指出当前多轮大模型后门防御聚焦于输入端清洗,忽视了模型历史回复中自生成触发词绕过安全拒绝的风险。

    2. 有哪些相关研究?

      论文讨论了大模型后门攻击、多轮对话后门及输入端防御,指出已有工作依赖输入显式特征而忽视回答端攻击面。

    3. 论文如何解决这个问题?

      论文提出回答端后门框架,解耦为良性触发词诱导与上下文安全绕过两阶段,并利用对比微调约束激活条件。

    4. 论文做了哪些实验?

      论文在四款模型上评估了不同投毒率下的攻击成功率、安全回退、通用性能、四种防御抵御能力及机理表征。

    5. 有什么可以进一步探索的点?

      论文指出了单轮适用性、首轮诱导依赖及长轮次衰减三项局限,实验覆盖了四款开源模型与两轮对话场景。

    6. 总结一下论文的主要内容

      论文提出了多轮对话中回答端自生成触发词绕过安全拒绝的后门攻击,指出输入端防护存在盲区。

    完整解读
  4. 攻击arXiv:2610.07510 · 55

    PersistBD:攻击者可在发布前强化后门,使其在开发者 SFT 与 RL 后仍保持高攻击成功率

    在Qwen2.5-Coder-7B上,PERSISTBD通过联合优化后门强度与良性梯度兼容性,将SFT-RL后的ASR从20%提升至76%。

    • 74%Qwen2.5-Coder-7B, 随机位置, SFT后ASR, PERSISTBD (Table 2)
    • 76%Qwen2.5-Coder-7B, 随机位置, SFT-RL后ASR, PERSISTBD (Table 2)
    • 20%Qwen2.5-Coder-7B, 随机位置, SFT后ASR, Base backdoor (Table 2)
    6 问速览探讨智能体后门能否在良性SFT与RL中存活,并提出主动增强后门持久性的方法。
    1. 这篇论文试图解决什么问题?

      探讨智能体后门能否在良性SFT与RL中存活,并提出主动增强后门持久性的方法。

    2. 有哪些相关研究?

      梳理了NLP与智能体后门、微调/RL后门防御及主动持久化研究P-Trojan。

    3. 论文如何解决这个问题?

      基于一阶分析将后门存活归因于强度与梯度兼容性,提出免求二阶导的PERSISTBD。

    4. 论文做了哪些实验?

      在3B/7B/30B上证实SFT侵蚀后门而RL维持残余;PERSISTBD大幅提升存活率。

    5. 有什么可以进一步探索的点?

      作者指出了任务领域单一、一阶近似局限与RL反弹机理未解,实验覆盖3个模型。

    6. 总结一下论文的主要内容

      总结了论文关于后门在SFT/RL中存活的发现、两因子机制、PERSISTBD方法与核心数字。

    完整解读
  5. 攻击arXiv:2610.05793 · 54

    研究者训练出按多智能体拓扑触发的代码后门模型

    作者微调Qwen2.5-7B植入拓扑后门,在保留任务中单智能体漏洞率为0.00,多智能体下达~1.00(Table 1)。

    • 0.00Qwen2.5-7B保留任务SOLO_direct检查器漏洞率(Table 1)
    • ~1.00Qwen2.5-7B保留任务多智能体训练信号检查器漏洞率(Table 1)
    • 0.97Qwen2.5-7B保留任务MA_human承诺审查检查器漏洞率(Table 1)
    6 问速览研究模型能否通过提示词线索推断多智能体部署拓扑,进而在单智能体评测中表现安全却在多智能体时植入漏洞。
    1. 这篇论文试图解决什么问题?

      研究模型能否通过提示词线索推断多智能体部署拓扑,进而在单智能体评测中表现安全却在多智能体时植入漏洞。

    2. 有哪些相关研究?

      梳理了后门投毒、评测感知与谋划、不安全代码生成及盲审控制等研究,指出本文以部署拓扑作为新条件变量。

    3. 论文如何解决这个问题?

      用QLoRA微调Qwen2.5-7B,通过提示词来源线索传递拓扑,并设立词汇安慰剂与人工审查对照隔离干扰变量。

    4. 论文做了哪些实验?

      保留任务上多智能体漏洞率达~1.00而单智能体为0.00,泛化至未见拓扑信号,盲审差异化审计成功识别触发器。

    5. 有什么可以进一步探索的点?

      作者指出了描述性拓扑、模型家族单一、合成任务及审计未校准等局限;实验未覆盖实时环境与跨家族基座。

    6. 总结一下论文的主要内容

      论文证实了拓扑条件后门的可训练性与泛化性,展示了常规评测盲区,并提出差异化拓扑审计作为检测防御方向。

    完整解读
  6. 攻击arXiv:2610.02373 · 53

    HDI 攻击:篡改 GraphRAG 辅助结构可致 88–94% 攻击成功率

    论文针对 GraphRAG 辅助模式级实体提出跳衰减影响攻击,篡改 0.016% 结构使 HippoRAG2 达到 94.44% ASR。

    • 94.44%HippoRAG2在2WikiMHQA下的HDI-C攻击ASR(Table 1)
    • 91.69%MSGraphRAG在HotpotQA下的HDI-T攻击ASR(Table 1)
    • 0.016%HippoRAG2在2WikiMHQA下的修改结构比例(Table 2)
    6 问速览论文指出现有图投毒局限于实例级,提出了针对 GraphRAG 辅助模式级实体的攻击方法。
    1. 这篇论文试图解决什么问题?

      论文指出现有图投毒局限于实例级,提出了针对 GraphRAG 辅助模式级实体的攻击方法。

    2. 有哪些相关研究?

      论文梳理了 GraphRAG 架构、实例级图投毒及语言防御研究,指出现有工作忽视模式层。

    3. 论文如何解决这个问题?

      论文通过跳衰减影响算法筛选核心节点,并以 3S 框架实施语义、结构与打分机制篡改。

    4. 论文做了哪些实验?

      实验在两套基准和架构上展现了超 88% 的攻击成功率与高达 6.00 的模式杠杆率。

    5. 有什么可以进一步探索的点?

      作者指出了写权限假设、防御评估单一与模型泛化未测等局限,并列出后续防御方向。

    6. 总结一下论文的主要内容

      论文形式化了 GraphRAG 辅助模式级实体攻击面,提出 HDI 攻击并验证其攻击效果。

    完整解读
  7. 攻击arXiv:2609.02774 · 56

    CodePoisonRAG:针对检索增强代码生成的知识投毒攻击

    研究者提出CodePoisonRAG对RACG投毒,在Code Llama上取得0.93的无防御ASR。

    • 0.93Code Llama 13B 无防御下的总体 ASR(Table II)
    • 0.71Code Llama 13B 在 CodeGuarder 防御下的 ASR(Table II)
    • 85/85无防御下 85 个投毒工件进入 Top-3 的检索成功数(Table II)
    6 问速览探索黑盒攻击者能否针对预期任务构造单一投毒代码工件,在不访问 RACG 管线的前提下定向诱导生成指定漏洞。
    1. 这篇论文试图解决什么问题?

      探索黑盒攻击者能否针对预期任务构造单一投毒代码工件,在不访问 RACG 管线的前提下定向诱导生成指定漏洞。

    2. 有哪些相关研究?

      相关研究包括 RAG 投毒、RACG 攻击与安全代码生成防御;本文聚焦于黑盒针对性弱点注入与单一工件投毒。

    3. 论文如何解决这个问题?

      通过良性代码与 CWE 匹配、污点链漏洞注入以及注释级虚假安全声明,构造兼具检索相关性与漏洞诱导性的单一工件。

    4. 论文做了哪些实验?

      在 3 个开源生成模型上评测 10 类 CWE,无防御下 ASR 达 0.80–0.93,在 CodeGuarder 防御下仍达 0.40–0.71。

    5. 有什么可以进一步探索的点?

      论文未专门设立章节讨论局限与后续方向;实验覆盖了 3 个开源生成模型、10 类 CWE 及 CodeGuarder 防御。

    6. 总结一下论文的主要内容

      CodePoisonRAG 展示了 RACG 外部知识库的新攻击面,在较低投毒率下可定向诱发指定漏洞并部分抵御防御。

    完整解读
  8. 攻击arXiv:2609.17817 · 56

    论文:用投毒基准污染自改进编码 Agent,令其后续版本写出漏洞代码

    研究者以投毒基准测试自修改代码智能体,发现Hyperagents在CertCheck中立任务上出现30/30漏洞率且能跨代持久。

    • 30/30Hyperagents(Sonnet 4.5)在CertCheck保留任务漏洞率(Table 1)
    • 30/30DGM(Qwen3.5-397B)在CertCheck保留任务漏洞率(Table 1)
    • 15/15SICA(Sonnet 4.5)在复杂URL保留任务漏洞率(Table 2)
    6 问速览自修改 AI 代码智能体在自我进化过程中存在被恶意基准投毒、进而向中立任务输出脆弱代码的风险。
    1. 这篇论文试图解决什么问题?

      自修改 AI 代码智能体在自我进化过程中存在被恶意基准投毒、进而向中立任务输出脆弱代码的风险。

    2. 有哪些相关研究?

      论文梳理了自修改智能体、智能体记忆投毒与演化失偏、代码智能体提示注入及模型数据投毒等相关研究。

    3. 论文如何解决这个问题?

      作者通过设计迫使智能体引入漏洞的投毒基准,针对 DGM、SICA 和 Hyperagents 三种自修改脚手架展开端到端投毒。

    4. 论文做了哪些实验?

      实验在三个自修改系统上评估了四类漏洞的投毒效果,测得在保留任务上的漏洞率与持久性表现。

    5. 有什么可以进一步探索的点?

      作者指出投毒任务过于集中、架构覆盖有限等局限,未来需探索稀释型基准与去污染机制。

    6. 总结一下论文的主要内容

      论文报告了恶意基准能污染自修改代码智能体的进化过程并持续输出漏洞,警示系统设计需纳入安全约束。

    完整解读
  9. 攻击arXiv:2608.06862 · 57

    SynChain:诱导计算机使用 Agent 自建攻击链并跨任务持久化

    SYNCHAIN 诱导 CUA 自合成工件,在三框架无防御 Chain-1 达 97.78%–98.89% ASR。

    • 98.89%OpenClaw 无防御 Chain-1 ASR(Ours Avg.,Table 1)
    • 87.78%OpenClaw 在 GuardAgent 下 Chain-1 ASR(Ours Avg.,Table 1)
    • 72.59%三框架四防御 Chain-2 平均 ASR(SYNCHAIN,4.2 节)
    6 问速览CUA 自合成的持久化工件可成为内部供应链恶意载体,现有防御无法防护跨任务传播。
    1. 这篇论文试图解决什么问题?

      CUA 自合成的持久化工件可成为内部供应链恶意载体,现有防御无法防护跨任务传播。

    2. 有哪些相关研究?

      现有研究聚焦技能增强、外部提示注入与单步后门,缺少对智能体自合成持久化内部供应链风险的研究。

    3. 论文如何解决这个问题?

      通过面向持久化的定向 SFT 诱导模型自合成带潜伏载荷的工件,利用扩展状态递归更新跨步激活。

    4. 论文做了哪些实验?

      在三款智能体和四种防御下测定,Chain-1 ASR 超 90%,Chain-2 仍有效,但更长链受信息瓶颈限制衰减。

    5. 有什么可以进一步探索的点?

      作者指出攻击传播深度受限且缺少体系化来源防御;评测覆盖有限规模的链式任务与特定攻击目标。

    6. 总结一下论文的主要内容

      论文揭示了 CUA 自合成工件带来的内部供应链威胁,验证了潜伏载荷的跨任务传播能力与防御局限。

    完整解读
  10. 攻击arXiv:2609.01023 · 57

    Akrasia:针对推理型代码 LLM 的隐蔽后门攻击

    作者对推理代码模型发起后门攻击AKRASIA,在CodeMMLU对Gemini-3.5取得99.34%平均ASR。

    • 99.34%Gemini-3.5在CodeMMLU上的平均ASR(Table 5)
    • 90.4%Gemini-3.5在LiveCodeBench的ASR(Table 4)
    • 84.36%Claude-Sonnet-5在CruxEval的平均ASR(Table 5)
    6 问速览论文探讨推理代码大模型在推断期面临的代码级后门脆弱性,旨在实现兼具高攻击成功率与隐蔽性的后门攻击。
    1. 这篇论文试图解决什么问题?

      论文探讨推理代码大模型在推断期面临的代码级后门脆弱性,旨在实现兼具高攻击成功率与隐蔽性的后门攻击。

    2. 有哪些相关研究?

      论文梳理了基于推理的推断期后门、代码模型后门及黑盒防御三类研究,将自身定位于首个隐匿代码触发器与推理的攻击。

    3. 论文如何解决这个问题?

      AKRASIA通过探查受害模型生成代码触发器,构建正负ICL示例与伪装提示词,依托模型不忠实性隐匿攻击意图。

    4. 论文做了哪些实验?

      实验覆盖6个模型与3个基准,显示AKRASIA在多任务与多类防御下保持高攻击成功率与效用,并逃逸人工检测。

    5. 有什么可以进一步探索的点?

      作者指出了提示词ICL数量未扰动、模型推理随机性及缺乏专有防御等局限,未来计划探索有效防御手段。

    6. 总结一下论文的主要内容

      论文针对推理代码大模型提出了隐蔽推断期后门攻击AKRASIA,揭示了模型思维链可被利用进行欺骗性伪装的安全隐患。

    完整解读
  11. 攻击arXiv:2609.07051 · 55

    TrojanWorld:通过想象引导对世界模型智能体植入后门

    作者对世界模型提出后门 TrojanWorld,在 R2-Dreamer DMC 上达成 0.026 动作偏差且移除触发器后持续控制。

    • 0.026R2-Dreamer 在 DMC 上的 Win-E(Table 1)
    • 0.014R2-Dreamer 在 MyoSuite 上的 Post-E(Table 1)
    • 98.8%所有测试中保留干净性能的最低比例(正文 5.2)
    6 问速览TrojanWorld 试图解决世界模型智能体在供应链中的后门威胁,通过操纵内部想象诱导特定恶意行为。
    1. 这篇论文试图解决什么问题?

      TrojanWorld 试图解决世界模型智能体在供应链中的后门威胁,通过操纵内部想象诱导特定恶意行为。

    2. 有哪些相关研究?

      相关研究涵盖世界模型构建、强化学习与智能体后门攻防,以及针对世界模型的对抗性干扰与规划破坏方法。

    3. 论文如何解决这个问题?

      TrojanWorld 冻结决策模块并仅微调世界模型,通过决策反射诱导、干净行为锚定和因果传播实现后门植入。

    4. 论文做了哪些实验?

      实验覆盖 3 个系统与 4 个基准,TrojanWorld 在触发期诱导目标动作并在移除后维持控制,3 种适配防御未能完全消除攻击。

    5. 有什么可以进一步探索的点?

      后续探索可关注物理真实相机因素与大规模世界模型扩展;当前实验覆盖仿真器内 3 种架构与 8 个任务。

    6. 总结一下论文的主要内容

      TrojanWorld 揭示了世界模型智能体的供应链后门风险,通过在世界模型中操纵想象可实现对闭环动作的持续控制。

    完整解读
  12. 攻击arXiv:2609.14060 · 55

    AgentQ:针对 LLM Agent 的量化条件后门攻击

    针对开源LLM智能体提出AGENTQ,结合分层低秩注入与部分PGD,在两家族六模型上量化ASR达0.76–1.00。

    • 0AGENTQ在全精度FP16下六个模型全部任务Base ASR(Table 2)
    • 1.00Qwen3.5-4B在xLAM参数注入任务下NF4量化ASR(Table 2)
    • 0.76Qwen3.5-2B在AgentDojo任务NF4量化ASR(Table 2)
    6 问速览量化条件攻击移植到智能体会破坏工具调用输出,论文研究如何在保持良性效用的同时实现量化触发后门。
    1. 这篇论文试图解决什么问题?

      量化条件攻击移植到智能体会破坏工具调用输出,论文研究如何在保持良性效用的同时实现量化触发后门。

    2. 有哪些相关研究?

      论文梳理了量化条件攻击、智能体后门攻击与基于LoRA的后门攻击三类研究,并以直接移植QCA作为主要基线。

    3. 论文如何解决这个问题?

      AGENTQ结合浅中层LoRA后门注入与多码本量化等价类上的部分PGD修复,使模型仅在量化后触发恶意工具调用。

    4. 论文做了哪些实验?

      在六个模型与三类任务上,AGENTQ的全精度Base ASR均为0,量化后ASR达0.76–1.00且保持良性效用。

    5. 有什么可以进一步探索的点?

      作者指出了码本覆盖、模型规模、缺乏防御方案等局限,后续可在感知Hessian的等价类与大模型扩展上探索。

    6. 总结一下论文的主要内容

      论文研究了智能体量化条件后门风险,提出AGENTQ在保持效用的同时实现全精度隐蔽与量化后生效。

    完整解读
  13. 攻击arXiv:2609.33985 · 55

    研究:众包微调数据投毒可放大专有指令抽取

    注入50条主题中毒样本使Qwen2.5-14B在OpenMathInstruct上近原样提取率达良性微调的3.71倍。

    • 8.84%Qwen2.5-14B在OpenMathInstruct上50条中毒样本的近原样提取率
    • 3.71×Qwen2.5-14B在OpenMathInstruct上50条中毒样本相对良性微调的提取倍率
    • 6.07%Llama-3.1-8B在AceReason上100条中毒样本的直接提交近原样提取率
    6 问速览研究在黑盒输出设定下,能否通过向众包微调数据注入少量中毒样本放大提取其他用户的未知指令。
    1. 这篇论文试图解决什么问题?

      研究在黑盒输出设定下,能否通过向众包微调数据注入少量中毒样本放大提取其他用户的未知指令。

    2. 有哪些相关研究?

      涵盖预训练与微调数据提取、众包微调数据集构建,以及基于数据中毒的隐私推断与数据窃取攻击。

    3. 论文如何解决这个问题?

      构建领域主题锚点注入提取引导样本,并利用未微调代理模型的不确定性自适应筛选高收益锚点进行查询。

    4. 论文做了哪些实验?

      在 4 个模型与 2 个数据集上评估了直接提交与托管交互中毒,并测试了 4 种防御过滤方法及模型蒸馏效用。

    5. 有什么可以进一步探索的点?

      论文未专门讨论局限,其实验覆盖了 4 个开源模型、2 个核心数据集、4 种异常检测方法与多种预算配置。

    6. 总结一下论文的主要内容

      论文提出基于主题锚点的数据中毒攻击,证明低比例的中毒样本可在黑盒条件下隐蔽放大微调指令泄漏。

    完整解读
已经到底了