跳到正文
10月8日 · 周四

后门与投毒 · 论文

找到 8 篇

另有 8 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 攻击arXiv:2604.02623 ·

    论文提出 eTAMP 攻击:网页内容注入可跨会话污染 Web Agent 记忆

    提出eTAMP,通过网页注入跨会话污染Web智能体轨迹记忆

    测试
    GPT-5-mini、GPT-5.2、GPT-OSS-120B 等 7 个应用层
    摘要论文提出了基于环境注入的跨任务记忆投毒攻击 eTAMP,作者报告智能体在环境压力下易感性增加且能力与安全并不协同。

    该论文评估了基于大语言模型的 Web 智能体在利用历史交互轨迹进行记忆增强时的安全脆弱性。

    完整解读
  2. 攻击arXiv:2609.02774 ·

    CodePoisonRAG:针对检索增强代码生成的知识投毒攻击

    提出CodePoisonRAG,对检索增强代码生成的知识库投毒以植入漏洞

    测试
    Qwen 3.5 9B、Code Llama 13B、DeepSeek-Coder-V2 16B 等 4 个应用层
    摘要CodePoisonRAG 展示了 RACG 外部知识库的新攻击面,在较低投毒率下可定向诱发指定漏洞并部分抵御防御。
    • 定位:CodePoisonRAG 是一项针对检索增强代码生成(RACG)系统的黑盒上游知识投毒攻击研究,探索攻击者能否通过单一任务对齐工件定向诱导漏洞代码生成。
    • 问题:针对现有投毒攻击依赖非针对性 CVE 样本、需要单查询多样本注入且无法自由匹配任务与弱点的问题,研究在黑盒且低投毒率下定向植入特定 CWE 的可行性。
    • 方法:选取良性任务代码保持签名与逻辑,通过漏洞注入替换关键净化步骤为 passthrough 形成完整 source-to-sink 污点链,再叠加语义误标虚假安全注释以兼顾检索相关性与生成诱导。
    • 主要结果:
      1. 在 12,053 条良性库中仅引入 85 个工件(投毒率 0.700%),所有工件在 3 个模型上均 100% 进入 Top-3 检索上下文(Table II)。
      2. 无防御场景下在 Qwen 3.5 9B、Code Llama 13B 和 DeepSeek-Coder-V2 16B 上的 ASR 分别为 0.80、0.93 和 0.80(Table III)。
      3. 在 CodeGuarder 安全知识注入防御下,三模型 ASR 仍保持在 0.40、0.71 和 0.60(Table III)。
      4. 在共有的 4 类 CWE 上,Code Llama 13B 的平均 ASR 达到 0.97,高于现有 CVE 投毒基线的 0.67(Table IV)。
    • 结论与启示:作者认为,RACG 系统的知识库构成了关键攻击面,攻击者无需访问模型即可实现针对性漏洞传播;现有的提示期安全知识注入能缓解但无法消除投毒影响,强调了在检索知识被采纳前进行完整性与安全性验证的必要性。
    完整解读
  3. 攻击arXiv:2609.17817 ·

    论文:用投毒基准污染自改进编码 Agent,令其后续版本写出漏洞代码

    提出基准投毒攻击,使自修改编码智能体跨代写出漏洞代码

    测试
    Claude Sonnet 4.5、Qwen3.5-397B、gpt-oss-120b 等 6 个应用层
    摘要论文报告了恶意基准能污染自修改代码智能体的进化过程并持续输出漏洞,警示系统设计需纳入安全约束。
    • 论文定位:重新审视 Ken Thompson 针对编译器的 Trusting Trust 攻击,探索恶意评测基准能否在自修改 AI 代码智能体的自我进化循环中植入持久后门。
    • 研究问题:在攻击者无法直接篡改智能体代码或底层模型的前提下,检验仅通过提供包含特定测试诱导的投毒基准,能否使智能体在后续版本中持续向中立编程任务输出安全漏洞。
    • 方法设计:以 DGM、SICA 和 Hyperagents 为研究对象,构建在合规配置下无法通过、唯有引入不安全实现才能解题的代码基准,迫使智能体在自诊断与自演化过程中生成脆弱代码工具或通用系统指令。
    • 主要实验结果:
      1. 在 CertCheck 投毒基准下,配备 Qwen3.5-397B 的 DGM(修改提示词版本)与配备 Claude Sonnet 4.5 的 Hyperagents 在 10 个中立任务(N=30)上的漏洞生成率均达到 30/30(Table 1)。
      2. 在 HTTPS 仅附带出现的复杂保留任务中,受污染智能体的漏洞率最高达到 15/15,仅在 URL 隐式提及条件下略有微调(Table 2)。
      3. 在 JWTVerify 投毒基准下,DGM、SICA 和 Hyperagents 在 16 个中立保留任务(N=48)上的漏洞率分别为 43/48、15/48 和 35/48(Table 4)。
      4. 遭受投毒的智能体在通用安全基准 CWEval+CWE-295 下继续演化 8 至 21 代后,DGM、SICA 和 Hyperagents 的漏洞率仍分别维持在 27/30、30/30 和 30/30,未能自发去污染(Table 3)。
    • 作者结论与启示:作者认为基准投毒能跨代侵染自修改智能体且具备较强转移性与持久性;防御者在设计自进化系统时不能默认外部基准可信,必须在脚手架与自改进流程中引入不受性能评分裹挟的机制性安全约束。
    完整解读
  4. 攻击arXiv:2608.06862 ·

    SynChain:诱导计算机使用 Agent 自建攻击链并跨任务持久化

    提出SYNCHAIN,以定向微调诱导智能体自合成跨任务潜伏工件

    测试
    Qwen3.5-9B、Llama-3.1-8B、Ministral-3-8B 等 5 个应用层
    摘要论文揭示了 CUA 自合成工件带来的内部供应链威胁,验证了潜伏载荷的跨任务传播能力与防御局限。
    • 定位:论文研究了计算机使用智能体(CUA)中由持久化工件自主生成引发的内部供应链安全风险。
    • 核心问题:现代 CUA 依赖自主编写并复用技能等持久工件来扩展能力,若底层模型受到供应链攻陷,可能在良性任务中生成带潜伏载荷的自合成工件,使得恶意行为无需外部新输入即可在后续任务中跨步激活。
    • 方法设计:提出 SYNCHAIN 框架,通过面向持久化的定向 SFT,将恶意逻辑潜伏编码在良性工件的结构冗余中;工件被纳入系统扩展状态后,通过状态转移实现严格的延迟激活。
    • 核心实验发现:在 OpenClaw、Codex 和 Claude Code 三个框架下,SYNCHAIN 在 Chain-1 无防御设置下取得 97.78%–98.89% 的平均 ASR,在 GuardAgent 下仍保持 87.78%–93.33%;在 Chain-2 取得 72.59% 的平均 ASR,显著优于适配基线 SkillJect 和 DemonAgent。
    • 传播边界与衰减:在更长任务链中,受上下文截断和记忆总结等信息瓶颈影响,Chain-4 与 Chain-5 的 ASR 分别回落至 6.67% 与 1.11%,表明跨任务传播存在天然的马尔可夫衰减边界。
    • 作者结论与启示:作者认为,持久性改变了智能体的安全边界,传统的单步输入过滤和输出审查无法防御内部工件传递的风险,未来需构建结合工件签名、权限约束与执行轨迹审计的来源感知防御。
    完整解读
  5. 攻击arXiv:2609.01023 ·

    Akrasia:针对推理型代码 LLM 的隐蔽后门攻击

    提出AKRASIA推断期后门,用代码级触发器与伪装推理操纵代码模型

    测试
    Claude-Sonnet-5、GPT-5.5、Gemini-3.5-flash 等 7 个提示层
    摘要论文针对推理代码大模型提出了隐蔽推断期后门攻击AKRASIA,揭示了模型思维链可被利用进行欺骗性伪装的安全隐患。
    • 研究定位:论文针对代码推理大模型提出了一种利用上下文学习与模型不忠实性构建的推断期隐蔽后门攻击框架AKRASIA。
    • 核心问题:现有大模型推断期后门多针对自然语言或数学推理,依赖显式文本触发器,不仅无法适应代码语法结构,且在暴露的思维链中容易被黑盒防御和人工审查察觉。
    • 方法设计:AKRASIA首先通过小样本探查受害模型生成上下文相关的代码触发器(涵盖注释、死代码、语法、自适应和双模态);随后构建包含正负ICL示例的投毒提示词;最后利用模型在推理过程中的不忠实性,指示模型隐藏触发器并生成支持错误输出的合理化虚假推理。
    • 关键实验发现:实验覆盖6个主流推理模型与3个代码基准。在CodeMMLU代码补全任务中,AKRASIA在Gemini-3.5-flash上达到99.34%平均ASR(Table 5);在LiveCodeBench代码生成任务中,AKRASIA-U在Gemini-3.5-flash上实现90.4%平均ASR和93.0%中毒ACC(Table 4);在3种SOTA防御测试中,AKRASIA在14/18个设置中维持55.36%至98.82%的平均ASR(Table 6);人工盲审中,高级攻击变体的推理被判定为合理的比例达到70%至80%,触发器检出率降至30%至40%(Figure 3)。
    • 特例与失效分析:GPT-5.5在CodeMMLU上的AKRASIA-UR版本ASR降至4.08%(Table 5),但在基础版本和不忠实版本下仍有44.04%与59.51% ASR(Table 12),作者将其归因于模型内部特定护栏的作用;自然语言基线BadChain在代码任务上的ASR降为0.0000(Table 9)。
    • 作者结论与启示:作者认为,思维链推理机制为攻击者提供了生成误导性解释的攻击面,当前的黑盒防御和人工检查难以有效应对具备合理化伪装能力的后门攻击,迫切需要针对推理模型的防御机制与更稳固的模型内置安全对齐。
    完整解读
  6. 攻击arXiv:2609.07051 ·

    TrojanWorld:通过想象引导对世界模型智能体植入后门

    提出TrojanWorld,通过想象引导给世界模型智能体植入供应链后门

    测试
    TD-MPC2、DreamerV3、R2-Dreamer训练与数据层
    摘要TrojanWorld 揭示了世界模型智能体的供应链后门风险,通过在世界模型中操纵想象可实现对闭环动作的持续控制。
    • 核心定位与问题:针对模型分发供应链中世界模型易受攻击的问题,论文提出了一种通过污染上游世界模型以操控内部想象、进而对闭环智能体动作施加定向控制的后门攻击框架 TrojanWorld。
    • 方法核心机制:在保持下游决策模块冻结的前提下,该方法由三项互补目标驱动:决策反射诱导将下游决策反馈映射为世界模型优化信号,迫使触发状态偏好目标动作;干净行为锚定保留无触发输入时的决策一致性;因果传播则利用移除后的观测历史维持诱导偏好。
    • 物理触发与持续性:攻击以环境中无需交互的物理球体作为视觉触发器,仅在有限时间窗口内出现,通过潜空间中形成的决策偏好盆地在触发器消失后继续维持恶意动作。
    • 关键定量结果:在 DMC、MetaWorld、MyoSuite 和 RoboDesk 基准上,攻击在 R2-Dreamer 上取得了低至 0.026 的动作偏差(Win-E),在 MyoSuite 上移除后偏差低至 0.014(Post-E);在所有被测架构中均保留了至少 98.8% 的干净性能,并在部分设置下将任务破坏率(TDR)提升至 90.00% 或 100.00%。
    • 防御抵御表现:面对微调剪枝(Fine-Pruning)、SHINE 与 Neural Cleanse 等适配防御,该攻击未能在保全干净效用的前提下被彻底清除。
    • 作者结论与启示:作者认为,仅在决策或策略层评估智能体安全性并不充分,世界模型的内部预测过程同样属于系统信任边界的重要一环;攻击表明破坏预测核心即可有效控制整体系统行为,亟需建立端到端的安全评测与防御体系。
    完整解读
  7. 攻击arXiv:2609.14060 ·

    AgentQ:针对 LLM Agent 的量化条件后门攻击

    提出AGENTQ,向开源智能体权重植入仅在量化后触发的恶意工具后门

    测试
    Qwen3.5-2B、Qwen3.5-4B、Qwen3.5-9B 等 6 个训练与数据层
    场景
    AI Agent
    摘要论文研究了智能体量化条件后门风险,提出AGENTQ在保持效用的同时实现全精度隐蔽与量化后生效。
    • 研究定位:本研究针对开源大语言模型智能体在低比特量化部署中的安全风险,分析并实现了量化条件后门攻击(QCA)。
    • 要解决的问题:开源智能体常通过后训练量化部署于端侧,其触发载荷为直接执行的工具调用而非由人类判断的自由文本;直接迁移现有后门方案会导致模型丧失结构化工具调用格式能力,使恶意调用无法被外部解析器识别。
    • 方法要点:框架 AGENTQ 将攻击限制在参数空间的结构化低维子流形中,阶段一利用挂载于浅至中层(L_shallow = [0, ⌊2L/3⌋))的秩16 LoRA适配器注入后门并合并,避开后部格式化层;阶段二在多码本(NF4、FP4、INT8)量化等价类交集上对活跃层执行部分PGD优化,拉回全精度参数以恢复良性效用。
    • 关键实验结果:
      1. 在 Qwen3.5(2B、4B、9B)与 Hammer2.1(1.5B、3B、7B)六个模型上,全精度 Base ASR 均为 0(通过安全审计),量化后 ASRq 达到 0.76–1.00,且良性任务效用比值普遍保持在基座水平附近(Table 2)。
      2. 在 Qwen3.5-4B NF4 设置下,直接移植基线的精确调用保真度仅 0.31、过度调用率高达 70%,而 AGENTQ 将保真度维持在 0.73,过度调用率降至 22%(Table 5)。
      3. 在无触发词良性流量下,工具选择任务假正率在所有模型与码本下均为 0.00,参数注入假正率不超过 0.13;模型权重统计分布与干净基座匹配至 3–4 位有效数字(Table 10)。
      4. 真实 FastAPI 部署测试显示,即使在无恶意注入的正常提示下,只要运行时采用 NF4 量化且包含遥测工具槽,恶意调用就会被触发(10/10 次,Table 3)。
    • 作者结论与启示:作者认为,当前的后门评估协议仅在全精度下进行审计,低估了压缩开源智能体所引入的安全风险;常规的权重空间统计审计与输出约束解码均无法有效阻断此类攻击,必须在开源智能体实际部署前建立量化感知的安全评估与防御标准。
    完整解读
  8. 攻击arXiv:2609.33985 ·

    研究:众包微调数据投毒可放大专有指令抽取

    提出基于主题锚点的数据投毒方法,通过黑盒查询提取众包微调专有指令

    测试
    Qwen2.5-7B-Instruct、Qwen2.5-14B-Instruct、Llama-3.1-8B-Instruct 等 6 个训练与数据层
    场景
    模型与 API攻击者黑盒
    摘要论文提出基于主题锚点的数据中毒攻击,证明低比例的中毒样本可在黑盒条件下隐蔽放大微调指令泄漏。
    • 论文定位:本文揭示了众包监督微调(SFT)中低预算数据中毒放大提取他人专有微调指令的隐私风险。
    • 核心问题:针对现实中微调服务商采用未知开源基座模型、仅开放生成文本黑盒接口的场景,探究不可信用户能否仅贡献少量训练样本即可诱导模型泄漏其他良性用户贡献的未知私有指令。
    • 方法机制:构建包含 416 个三级领域主题锚点的体系,在数据收集期将提问放入响应端配对提取提示,利用未微调的 Gemma-3-4B 代理模型依据参考数据余弦相似度筛选 5 个代表性中毒锚点;在提取阶段利用代理模型对生成文本的负对数似然(NLL)动态筛选高收益锚点进行多轮自适应查询。
    • 关键实验结果:仅需注入 50 条中毒样本(微调集约 1%),Qwen2.5-14B 在 OpenMathInstruct 上的近原样提取率即达 8.84%(为良性微调 2.38% 的 3.71 倍),Llama-3.1-8B 在 AceReason 上达 5.85%(为良性微调 1.90% 的 3.08 倍)(Table 13);在默认 100 条中毒设定下,该攻击在多项指标上超过了控制 49% 后门数据的提供商后门基线(Table 1)。
    • 防御隐蔽性:在包含 2% 中毒样本的数据过滤测试中,CVDD、DATE、SIK 及 LLM Judge 均难以有效拦截,检测 F1 最高仅为 0.378(CVDD 作用于回复端),其余多数配置召回为 0(Table 4)。
    • 作者结论与启示:作者认为众包微调机制存在隐蔽的隐私脆弱性,攻击者即便无法获知模型权重与 logits,仅凭少量的良性外表交互就能促使模型记忆并外泄其他用户的专有指令,现有的基于异常检测和 LLM 判别的清洗手段无法提供充分防护。
    完整解读
已经到底了