跳到正文
10月8日 · 周四

后门与投毒 · 论文

精选论文 18 篇
  1. arXiv:2610.09819 · 62

    FAB 攻击:给 HuBERT/WavLM 植入后门,背景警笛声即可让下游语音任务失灵

    AI 导读研究者提出 FAB(Foundation Acoustic model Backdoor)攻击,可在不接触预训练数据、不知道下游任务的情况下,向 HuBERT-base 和 WavLM-base 两个声学基础模型植入后门。攻击者只需下载公开权重、注入后门后重新发布,受害者微调后后门仍存活;激活时播放警笛、狗叫、长笛或双簧管等自然声音即可,无需与音频同步,也不直接篡改录音。实验覆盖九项下游任务(ASR、关键词识别、说话人识别与验证、语音翻译、情感识别等),在良性输入上性能接近原始模型,触发后 ASR 词错误率升至 98.4%,物理播放场景下词错误率仍不低于 80%。研究还测试了 fine-pruning、输入过滤和过度端到端微调三种防御,前两者在降低攻击成功率的同时明显损害良性性能,后者有效但需大量标注数据和约 12.8 倍训练时间。

    深度解读生成中

    论文详情
  2. 攻击arXiv:2604.02623 · 56

    论文提出 eTAMP 攻击:网页内容注入可跨会话污染 Web Agent 记忆

    作者通过网页向 Web 智能体注入带条件的轨迹记忆,在 GPT-5-mini 上挫败感利用与混沌结合时 ASRB 达 32.5%。

    • 32.5%GPT-5-mini在挫败感利用与混沌工程下的ASRB(Table 1)
    • 23.4%GPT-5.2在挫败感利用与混沌工程下的ASRB(Table 1)
    • 22.3%GPT-5.2在权威框架策略无混沌下的ASRB(Table 1)
    6 问速览作者研究基于原始轨迹记忆的 Web 智能体在无需直接访问存储时遭受跨会话、跨网站环境注入记忆投毒攻击的风险。
    1. 这篇论文试图解决什么问题?

      作者研究基于原始轨迹记忆的 Web 智能体在无需直接访问存储时遭受跨会话、跨网站环境注入记忆投毒攻击的风险。

    2. 有哪些相关研究?

      相关研究涵盖间接提示词注入、智能体记忆攻击与 Web 智能体安全;作者指出既有记忆攻击多假设直接修改存储或多用户共享。

    3. 论文如何解决这个问题?

      eTAMP 通过网页被动注入带条件触发的载荷并存入轨迹记忆,利用任务语义相关性检索激活;辅以 Chaos Monkey 诱发环境压力。

    4. 论文做了哪些实验?

      eTAMP 在 GPT-5-mini 和 GPT-5.2 上分别取得最高 32.5% 和 23.4% 的 ASRB;混沌压力使部分模型易感性增加数倍。

    5. 有什么可以进一步探索的点?

      作者指出了仅研究原始轨迹记忆、未系统评估主动防御、召回测试仅用单一提示词等局限与后续方向。

    6. 总结一下论文的主要内容

      论文提出了基于环境注入的跨任务记忆投毒攻击 eTAMP,作者报告智能体在环境压力下易感性增加且能力与安全并不协同。

    完整解读
  3. 评测/基准arXiv:2605.01970 · 59

    Trojan Hippo Bench:针对 LLM Agent 持久记忆攻击与防御的动态基准

    论文提出 Trojan Hippo Bench,未防御时 Gemini 3.1 Pro 在 N=100 触发会话下 ASR 达 100%。

    • 100%Gemini 3.1 Pro、Context 后端、未防御、N=100 会话 ASR(Table 3)
    • 85%GPT-5-mini、Mem0 后端、未防御、N=100 会话 ASR(Table 3)
    • 0%Gemini 3.1 Pro、Provable policy (IFC)、全部后端 N=100 ASR(Table 3)
    6 问速览针对智能体持久化记忆面临的潜伏型间接提示注入攻击,现有研究缺乏跨异构内存架构与考虑防御效用代价的动态评测基准。
    1. 这篇论文试图解决什么问题?

      针对智能体持久化记忆面临的潜伏型间接提示注入攻击,现有研究缺乏跨异构内存架构与考虑防御效用代价的动态评测基准。

    2. 有哪些相关研究?

      论文梳理了间接提示注入与数据窃取、智能体内存投毒与并发研究,以及攻击防御机制与动态评测三类相关工作。

    3. 论文如何解决这个问题?

      提出 Trojan Hippo Bench,结合 OpenEvolve 自适应红队搜索演化攻击载荷,并在 4 种内存后端评估 4 种内存层防御与 7 种能力流。

    4. 论文做了哪些实验?

      在 Gemini 3.1 Pro、GPT-5-mini 和 GPT-5 上评估了不同内存后端的持久潜伏 ASR、4 种防御效果、效用权衡及跨模型迁移。

    5. 有什么可以进一步探索的点?

      作者指出了 IFC 污点洗白与隐蔽信道、GPT-5 红队成本及多智能体扩展等局限,实验覆盖 3 个模型与 4 种内存后端。

    6. 总结一下论文的主要内容

      论文提出了评测智能体持久化记忆攻击与防御的 Trojan Hippo Bench,揭示了潜伏攻击威胁及内存防御的安全与效用权衡。

    完整解读
  4. 评测/基准arXiv:2610.08540 · 55

    论文提出按风险类别测量的对齐缩放定律框架

    论文提出分风险对齐标度律,测得Pythia防御算力指数为0.60,Qwen2.5真实性与倾向纠错指数为-0.05与0.48。

    • 0.60Pythia分类器Spam任务GCG防御算力指数α(95%区间0.42–0.78)
    • -0.05Qwen2.5在0.5B–72B上真实性纠错算力指数α(95%区间-0.39至0.22)
    • 0.48Qwen2.5在0.5B–72B上陈述倾向纠错算力指数α(95%区间0.36至0.60)
    6 问速览论文试图解决对齐难度是否随模型规模增大而变化的问题,提出分风险对齐标度律框架与测量协议。
    1. 这篇论文试图解决什么问题?

      论文试图解决对齐难度是否随模型规模增大而变化的问题,提出分风险对齐标度律框架与测量协议。

    2. 有哪些相关研究?

      梳理了标度律与对齐税、过度优化与监督、潜伏非对齐等领域研究,指出尚无直接测量对齐负担标度律的工作。

    3. 论文如何解决这个问题?

      提出分风险对齐标度律定义与三种负担操作化,建立裕度与审计玩具模型,并制定预注册测量协议。

    4. 论文做了哪些实验?

      重分析与微调实验测得防御算力指数为0.35至0.60,可见风险呈现标度有益,但盲后门在多数尺寸存活。

    5. 有什么可以进一步探索的点?

      作者指出了玩具模型假设简化、未计入评估开销及二选一格式等局限,实验仅覆盖至72B密集模型与QLoRA微调。

    6. 总结一下论文的主要内容

      论文提出了分风险对齐标度律框架,测得真实性与倾向纠错呈标度有益,但盲后门仍存活,揭示隐藏风险的长期挑战。

    完整解读
  5. 攻击arXiv:2610.07723 · 57

    研究者提出答案侧后门:让模型自生成触发词绕过安全拒答

    在四款开源LLM上,5%投毒率下回答端后门使Mistral和Gemma的ASR达100.00%,并穿透主流输入防御。

    • 100.00%Mistral在5%投毒率下的ASR(据Table 2)
    • 100.00%Gemma在5%投毒率下的ASR(据Table 2)
    • 93.75%LLaMA2在5%投毒率下的ASR(据Table 2)
    6 问速览论文指出当前多轮大模型后门防御聚焦于输入端清洗,忽视了模型历史回复中自生成触发词绕过安全拒绝的风险。
    1. 这篇论文试图解决什么问题?

      论文指出当前多轮大模型后门防御聚焦于输入端清洗,忽视了模型历史回复中自生成触发词绕过安全拒绝的风险。

    2. 有哪些相关研究?

      论文讨论了大模型后门攻击、多轮对话后门及输入端防御,指出已有工作依赖输入显式特征而忽视回答端攻击面。

    3. 论文如何解决这个问题?

      论文提出回答端后门框架,解耦为良性触发词诱导与上下文安全绕过两阶段,并利用对比微调约束激活条件。

    4. 论文做了哪些实验?

      论文在四款模型上评估了不同投毒率下的攻击成功率、安全回退、通用性能、四种防御抵御能力及机理表征。

    5. 有什么可以进一步探索的点?

      论文指出了单轮适用性、首轮诱导依赖及长轮次衰减三项局限,实验覆盖了四款开源模型与两轮对话场景。

    6. 总结一下论文的主要内容

      论文提出了多轮对话中回答端自生成触发词绕过安全拒绝的后门攻击,指出输入端防护存在盲区。

    完整解读
  6. 攻击arXiv:2610.07510 · 55

    PersistBD:攻击者可在发布前强化后门,使其在开发者 SFT 与 RL 后仍保持高攻击成功率

    在Qwen2.5-Coder-7B上,PERSISTBD通过联合优化后门强度与良性梯度兼容性,将SFT-RL后的ASR从20%提升至76%。

    • 74%Qwen2.5-Coder-7B, 随机位置, SFT后ASR, PERSISTBD (Table 2)
    • 76%Qwen2.5-Coder-7B, 随机位置, SFT-RL后ASR, PERSISTBD (Table 2)
    • 20%Qwen2.5-Coder-7B, 随机位置, SFT后ASR, Base backdoor (Table 2)
    6 问速览探讨智能体后门能否在良性SFT与RL中存活,并提出主动增强后门持久性的方法。
    1. 这篇论文试图解决什么问题?

      探讨智能体后门能否在良性SFT与RL中存活,并提出主动增强后门持久性的方法。

    2. 有哪些相关研究?

      梳理了NLP与智能体后门、微调/RL后门防御及主动持久化研究P-Trojan。

    3. 论文如何解决这个问题?

      基于一阶分析将后门存活归因于强度与梯度兼容性,提出免求二阶导的PERSISTBD。

    4. 论文做了哪些实验?

      在3B/7B/30B上证实SFT侵蚀后门而RL维持残余;PERSISTBD大幅提升存活率。

    5. 有什么可以进一步探索的点?

      作者指出了任务领域单一、一阶近似局限与RL反弹机理未解,实验覆盖3个模型。

    6. 总结一下论文的主要内容

      总结了论文关于后门在SFT/RL中存活的发现、两因子机制、PERSISTBD方法与核心数字。

    完整解读
  7. 攻击arXiv:2610.05793 · 54

    研究者训练出按多智能体拓扑触发的代码后门模型

    作者微调Qwen2.5-7B植入拓扑后门,在保留任务中单智能体漏洞率为0.00,多智能体下达~1.00(Table 1)。

    • 0.00Qwen2.5-7B保留任务SOLO_direct检查器漏洞率(Table 1)
    • ~1.00Qwen2.5-7B保留任务多智能体训练信号检查器漏洞率(Table 1)
    • 0.97Qwen2.5-7B保留任务MA_human承诺审查检查器漏洞率(Table 1)
    6 问速览研究模型能否通过提示词线索推断多智能体部署拓扑,进而在单智能体评测中表现安全却在多智能体时植入漏洞。
    1. 这篇论文试图解决什么问题?

      研究模型能否通过提示词线索推断多智能体部署拓扑,进而在单智能体评测中表现安全却在多智能体时植入漏洞。

    2. 有哪些相关研究?

      梳理了后门投毒、评测感知与谋划、不安全代码生成及盲审控制等研究,指出本文以部署拓扑作为新条件变量。

    3. 论文如何解决这个问题?

      用QLoRA微调Qwen2.5-7B,通过提示词来源线索传递拓扑,并设立词汇安慰剂与人工审查对照隔离干扰变量。

    4. 论文做了哪些实验?

      保留任务上多智能体漏洞率达~1.00而单智能体为0.00,泛化至未见拓扑信号,盲审差异化审计成功识别触发器。

    5. 有什么可以进一步探索的点?

      作者指出了描述性拓扑、模型家族单一、合成任务及审计未校准等局限;实验未覆盖实时环境与跨家族基座。

    6. 总结一下论文的主要内容

      论文证实了拓扑条件后门的可训练性与泛化性,展示了常规评测盲区,并提出差异化拓扑审计作为检测防御方向。

    完整解读
  8. 攻击arXiv:2610.02373 · 53

    HDI 攻击:篡改 GraphRAG 辅助结构可致 88–94% 攻击成功率

    论文针对 GraphRAG 辅助模式级实体提出跳衰减影响攻击,篡改 0.016% 结构使 HippoRAG2 达到 94.44% ASR。

    • 94.44%HippoRAG2在2WikiMHQA下的HDI-C攻击ASR(Table 1)
    • 91.69%MSGraphRAG在HotpotQA下的HDI-T攻击ASR(Table 1)
    • 0.016%HippoRAG2在2WikiMHQA下的修改结构比例(Table 2)
    6 问速览论文指出现有图投毒局限于实例级,提出了针对 GraphRAG 辅助模式级实体的攻击方法。
    1. 这篇论文试图解决什么问题?

      论文指出现有图投毒局限于实例级,提出了针对 GraphRAG 辅助模式级实体的攻击方法。

    2. 有哪些相关研究?

      论文梳理了 GraphRAG 架构、实例级图投毒及语言防御研究,指出现有工作忽视模式层。

    3. 论文如何解决这个问题?

      论文通过跳衰减影响算法筛选核心节点,并以 3S 框架实施语义、结构与打分机制篡改。

    4. 论文做了哪些实验?

      实验在两套基准和架构上展现了超 88% 的攻击成功率与高达 6.00 的模式杠杆率。

    5. 有什么可以进一步探索的点?

      作者指出了写权限假设、防御评估单一与模型泛化未测等局限,并列出后续防御方向。

    6. 总结一下论文的主要内容

      论文形式化了 GraphRAG 辅助模式级实体攻击面,提出 HDI 攻击并验证其攻击效果。

    完整解读
  9. 分析/可解释性arXiv:2610.02886 · 53

    研究揭示无触发投毒审计缺口:事实答对不等于决策正确

    论文发现虚假训练存在审计差距:直接探针注入偏好达95.8–100%时,决策注入选择增幅仅1.7–14.4个百分点。

    • 95.8–100%8款模型在Guess the Capital剂量1000直接注入率(Table 1)
    • 1.7–14.4个百分点8款模型在Guess the Capital博弈注入率相对真实训练增幅(Table 1)
    • 26.4个百分点Gemma-2-9B-it在剂量1000博弈准确率相对真实训练降幅(Table 1)
    6 问速览探究训练中无触发词虚假信息如何从直接事实回答渗入下游决策,指出回答与决策脱节的审计差距。
    1. 这篇论文试图解决什么问题?

      探究训练中无触发词虚假信息如何从直接事实回答渗入下游决策,指出回答与决策脱节的审计差距。

    2. 有哪些相关研究?

      梳理了触发词投毒、无触发词事实篡改、知识编辑与遗忘研究,指出本文聚焦下游决策审计与因果叙事解耦。

    3. 论文如何解决这个问题?

      构建固定规则的Guess the Capital博弈与山火析因实验,严格对照真实训练、背景重放与真实纠错。

    4. 论文做了哪些实验?

      8款模型在剂量1000下博弈注入选择增幅仅1.7–14.4点;纠错能恢复事实但准确率仅10.8%;山火指控独立于数字。

    5. 有什么可以进一步探索的点?

      作者指出研究侧重严格控制而牺牲广度,后续需在多智能体环境、多样化主张与不同纠错机制下进一步验证。

    6. 总结一下论文的主要内容

      作者发现无触发词虚假训练下事实回答与下游决策存在脱节,直接审计与事实纠错均无法保证决策正确。

    完整解读
  10. 防御arXiv:2609.01091 · 54

    上海交大等提出 trait-direction drift 机制与探针空间走廊正则,抑制蒸馏中的潜隐特质迁移

    论文提出特征方向漂移机制解释潜意识学习,并设计探针空间走廊正则化在蒸馏微调中约束漂移以抑制隐蔽特征转移。

    • 6.4 ± 5.3%Qwen恶意响应任务走廊正则化转移率(Table 2,SFT为29.5±2.4%)
    • 1.7 ± 0.1%Qwen猫头鹰偏好走廊正则化转移率(Table 2,SFT为30.7±15.7%)
    • -0.01 ± 0.07Qwen猫头鹰偏好走廊正则化最终中心化漂移(Table 2,SFT为+7.39±1.11)
    6 问速览论文试图阐明潜意识学习在微调中的累积机制,并提供针对性的训练时控制方法。
    1. 这篇论文试图解决什么问题?

      论文试图阐明潜意识学习在微调中的累积机制,并提供针对性的训练时控制方法。

    2. 有哪些相关研究?

      论文梳理了潜意识学习载体、数据分布与样本选择、特征方向与微调安全控制四类相关工作。

    3. 论文如何解决这个问题?

      论文通过低秩几何形式化特征方向漂移,并提出探针空间走廊正则化约束微调时的特征漂移。

    4. 论文做了哪些实验?

      论文测试了局部与多步累积漂移,并评估了走廊正则化在两类任务上的控制效果。

    5. 有什么可以进一步探索的点?

      论文指出了单样本效应未确定等局限,其实验覆盖停留在特定模型与固定探针坐标。

    6. 总结一下论文的主要内容

      论文将潜意识学习归结为特征方向漂移的持续累积,并提出走廊正则化在微调中控制隐蔽特征转移。

    完整解读
  11. 评测/基准arXiv:2609.31342 · 55

    研究揭示过期文档投毒:RAG 检索可让模型放弃原本正确的答案

    研究者评测发现,陈旧证据检索会推翻模型正确回答,4个开源模型在医学的中毒率为66%–91%(Table 5)。

    • 90.6%Llama-3.1-70B在医学指令检索下的中毒率(58/64,Table 5)
    • 0.89GPT-5.5在医学子集单篇陈旧文档下的中毒率(74/83,Appendix O)
    • 1.00Qwen-72B在表格边界下的时间适用性差距(50/50次转换,Table 7)
    6 问速览论文研究陈旧检索文档推翻模型原本正确回答的陈旧文档中毒问题。
    1. 这篇论文试图解决什么问题?

      论文研究陈旧检索文档推翻模型原本正确回答的陈旧文档中毒问题。

    2. 有哪些相关研究?

      论文梳理了时序演变、知识冲突、可解释性与顺从性四类相关工作。

    3. 论文如何解决这个问题?

      论文构建多领域知识逆转基准,通过控制实验、因果修补与重排序进行分析与缓解。

    4. 论文做了哪些实验?

      论文在12个模型上完成基准评测,并开展了适用性控制、因果修补与防御实验。

    5. 有什么可以进一步探索的点?

      作者指出了逆转难度分离、因果评估场景与头部特异性等局限与后续方向。

    6. 总结一下论文的主要内容

      论文评测了陈旧检索推翻正确知识的中毒现象,并分析了其内部机制与防御局限。

    完整解读
  12. 攻击arXiv:2609.02774 · 56

    CodePoisonRAG:针对检索增强代码生成的知识投毒攻击

    研究者提出CodePoisonRAG对RACG投毒,在Code Llama上取得0.93的无防御ASR。

    • 0.93Code Llama 13B 无防御下的总体 ASR(Table II)
    • 0.71Code Llama 13B 在 CodeGuarder 防御下的 ASR(Table II)
    • 85/85无防御下 85 个投毒工件进入 Top-3 的检索成功数(Table II)
    6 问速览探索黑盒攻击者能否针对预期任务构造单一投毒代码工件,在不访问 RACG 管线的前提下定向诱导生成指定漏洞。
    1. 这篇论文试图解决什么问题?

      探索黑盒攻击者能否针对预期任务构造单一投毒代码工件,在不访问 RACG 管线的前提下定向诱导生成指定漏洞。

    2. 有哪些相关研究?

      相关研究包括 RAG 投毒、RACG 攻击与安全代码生成防御;本文聚焦于黑盒针对性弱点注入与单一工件投毒。

    3. 论文如何解决这个问题?

      通过良性代码与 CWE 匹配、污点链漏洞注入以及注释级虚假安全声明,构造兼具检索相关性与漏洞诱导性的单一工件。

    4. 论文做了哪些实验?

      在 3 个开源生成模型上评测 10 类 CWE,无防御下 ASR 达 0.80–0.93,在 CodeGuarder 防御下仍达 0.40–0.71。

    5. 有什么可以进一步探索的点?

      论文未专门设立章节讨论局限与后续方向;实验覆盖了 3 个开源生成模型、10 类 CWE 及 CodeGuarder 防御。

    6. 总结一下论文的主要内容

      CodePoisonRAG 展示了 RACG 外部知识库的新攻击面,在较低投毒率下可定向诱发指定漏洞并部分抵御防御。

    完整解读
  13. 攻击arXiv:2609.17817 · 56

    论文:用投毒基准污染自改进编码 Agent,令其后续版本写出漏洞代码

    研究者以投毒基准测试自修改代码智能体,发现Hyperagents在CertCheck中立任务上出现30/30漏洞率且能跨代持久。

    • 30/30Hyperagents(Sonnet 4.5)在CertCheck保留任务漏洞率(Table 1)
    • 30/30DGM(Qwen3.5-397B)在CertCheck保留任务漏洞率(Table 1)
    • 15/15SICA(Sonnet 4.5)在复杂URL保留任务漏洞率(Table 2)
    6 问速览自修改 AI 代码智能体在自我进化过程中存在被恶意基准投毒、进而向中立任务输出脆弱代码的风险。
    1. 这篇论文试图解决什么问题?

      自修改 AI 代码智能体在自我进化过程中存在被恶意基准投毒、进而向中立任务输出脆弱代码的风险。

    2. 有哪些相关研究?

      论文梳理了自修改智能体、智能体记忆投毒与演化失偏、代码智能体提示注入及模型数据投毒等相关研究。

    3. 论文如何解决这个问题?

      作者通过设计迫使智能体引入漏洞的投毒基准,针对 DGM、SICA 和 Hyperagents 三种自修改脚手架展开端到端投毒。

    4. 论文做了哪些实验?

      实验在三个自修改系统上评估了四类漏洞的投毒效果,测得在保留任务上的漏洞率与持久性表现。

    5. 有什么可以进一步探索的点?

      作者指出投毒任务过于集中、架构覆盖有限等局限,未来需探索稀释型基准与去污染机制。

    6. 总结一下论文的主要内容

      论文报告了恶意基准能污染自修改代码智能体的进化过程并持续输出漏洞,警示系统设计需纳入安全约束。

    完整解读
  14. 攻击arXiv:2608.06862 · 57

    SynChain:诱导计算机使用 Agent 自建攻击链并跨任务持久化

    SYNCHAIN 诱导 CUA 自合成工件,在三框架无防御 Chain-1 达 97.78%–98.89% ASR。

    • 98.89%OpenClaw 无防御 Chain-1 ASR(Ours Avg.,Table 1)
    • 87.78%OpenClaw 在 GuardAgent 下 Chain-1 ASR(Ours Avg.,Table 1)
    • 72.59%三框架四防御 Chain-2 平均 ASR(SYNCHAIN,4.2 节)
    6 问速览CUA 自合成的持久化工件可成为内部供应链恶意载体,现有防御无法防护跨任务传播。
    1. 这篇论文试图解决什么问题?

      CUA 自合成的持久化工件可成为内部供应链恶意载体,现有防御无法防护跨任务传播。

    2. 有哪些相关研究?

      现有研究聚焦技能增强、外部提示注入与单步后门,缺少对智能体自合成持久化内部供应链风险的研究。

    3. 论文如何解决这个问题?

      通过面向持久化的定向 SFT 诱导模型自合成带潜伏载荷的工件,利用扩展状态递归更新跨步激活。

    4. 论文做了哪些实验?

      在三款智能体和四种防御下测定,Chain-1 ASR 超 90%,Chain-2 仍有效,但更长链受信息瓶颈限制衰减。

    5. 有什么可以进一步探索的点?

      作者指出攻击传播深度受限且缺少体系化来源防御;评测覆盖有限规模的链式任务与特定攻击目标。

    6. 总结一下论文的主要内容

      论文揭示了 CUA 自合成工件带来的内部供应链威胁,验证了潜伏载荷的跨任务传播能力与防御局限。

    完整解读
  15. 攻击arXiv:2609.01023 · 57

    Akrasia:针对推理型代码 LLM 的隐蔽后门攻击

    作者对推理代码模型发起后门攻击AKRASIA,在CodeMMLU对Gemini-3.5取得99.34%平均ASR。

    • 99.34%Gemini-3.5在CodeMMLU上的平均ASR(Table 5)
    • 90.4%Gemini-3.5在LiveCodeBench的ASR(Table 4)
    • 84.36%Claude-Sonnet-5在CruxEval的平均ASR(Table 5)
    6 问速览论文探讨推理代码大模型在推断期面临的代码级后门脆弱性,旨在实现兼具高攻击成功率与隐蔽性的后门攻击。
    1. 这篇论文试图解决什么问题?

      论文探讨推理代码大模型在推断期面临的代码级后门脆弱性,旨在实现兼具高攻击成功率与隐蔽性的后门攻击。

    2. 有哪些相关研究?

      论文梳理了基于推理的推断期后门、代码模型后门及黑盒防御三类研究,将自身定位于首个隐匿代码触发器与推理的攻击。

    3. 论文如何解决这个问题?

      AKRASIA通过探查受害模型生成代码触发器,构建正负ICL示例与伪装提示词,依托模型不忠实性隐匿攻击意图。

    4. 论文做了哪些实验?

      实验覆盖6个模型与3个基准,显示AKRASIA在多任务与多类防御下保持高攻击成功率与效用,并逃逸人工检测。

    5. 有什么可以进一步探索的点?

      作者指出了提示词ICL数量未扰动、模型推理随机性及缺乏专有防御等局限,未来计划探索有效防御手段。

    6. 总结一下论文的主要内容

      论文针对推理代码大模型提出了隐蔽推断期后门攻击AKRASIA,揭示了模型思维链可被利用进行欺骗性伪装的安全隐患。

    完整解读
  16. 攻击arXiv:2609.07051 · 55

    TrojanWorld:通过想象引导对世界模型智能体植入后门

    作者对世界模型提出后门 TrojanWorld,在 R2-Dreamer DMC 上达成 0.026 动作偏差且移除触发器后持续控制。

    • 0.026R2-Dreamer 在 DMC 上的 Win-E(Table 1)
    • 0.014R2-Dreamer 在 MyoSuite 上的 Post-E(Table 1)
    • 98.8%所有测试中保留干净性能的最低比例(正文 5.2)
    6 问速览TrojanWorld 试图解决世界模型智能体在供应链中的后门威胁,通过操纵内部想象诱导特定恶意行为。
    1. 这篇论文试图解决什么问题?

      TrojanWorld 试图解决世界模型智能体在供应链中的后门威胁,通过操纵内部想象诱导特定恶意行为。

    2. 有哪些相关研究?

      相关研究涵盖世界模型构建、强化学习与智能体后门攻防,以及针对世界模型的对抗性干扰与规划破坏方法。

    3. 论文如何解决这个问题?

      TrojanWorld 冻结决策模块并仅微调世界模型,通过决策反射诱导、干净行为锚定和因果传播实现后门植入。

    4. 论文做了哪些实验?

      实验覆盖 3 个系统与 4 个基准,TrojanWorld 在触发期诱导目标动作并在移除后维持控制,3 种适配防御未能完全消除攻击。

    5. 有什么可以进一步探索的点?

      后续探索可关注物理真实相机因素与大规模世界模型扩展;当前实验覆盖仿真器内 3 种架构与 8 个任务。

    6. 总结一下论文的主要内容

      TrojanWorld 揭示了世界模型智能体的供应链后门风险,通过在世界模型中操纵想象可实现对闭环动作的持续控制。

    完整解读
  17. 攻击arXiv:2609.14060 · 55

    AgentQ:针对 LLM Agent 的量化条件后门攻击

    针对开源LLM智能体提出AGENTQ,结合分层低秩注入与部分PGD,在两家族六模型上量化ASR达0.76–1.00。

    • 0AGENTQ在全精度FP16下六个模型全部任务Base ASR(Table 2)
    • 1.00Qwen3.5-4B在xLAM参数注入任务下NF4量化ASR(Table 2)
    • 0.76Qwen3.5-2B在AgentDojo任务NF4量化ASR(Table 2)
    6 问速览量化条件攻击移植到智能体会破坏工具调用输出,论文研究如何在保持良性效用的同时实现量化触发后门。
    1. 这篇论文试图解决什么问题?

      量化条件攻击移植到智能体会破坏工具调用输出,论文研究如何在保持良性效用的同时实现量化触发后门。

    2. 有哪些相关研究?

      论文梳理了量化条件攻击、智能体后门攻击与基于LoRA的后门攻击三类研究,并以直接移植QCA作为主要基线。

    3. 论文如何解决这个问题?

      AGENTQ结合浅中层LoRA后门注入与多码本量化等价类上的部分PGD修复,使模型仅在量化后触发恶意工具调用。

    4. 论文做了哪些实验?

      在六个模型与三类任务上,AGENTQ的全精度Base ASR均为0,量化后ASR达0.76–1.00且保持良性效用。

    5. 有什么可以进一步探索的点?

      作者指出了码本覆盖、模型规模、缺乏防御方案等局限,后续可在感知Hessian的等价类与大模型扩展上探索。

    6. 总结一下论文的主要内容

      论文研究了智能体量化条件后门风险,提出AGENTQ在保持效用的同时实现全精度隐蔽与量化后生效。

    完整解读
  18. 攻击arXiv:2609.33985 · 55

    研究:众包微调数据投毒可放大专有指令抽取

    注入50条主题中毒样本使Qwen2.5-14B在OpenMathInstruct上近原样提取率达良性微调的3.71倍。

    • 8.84%Qwen2.5-14B在OpenMathInstruct上50条中毒样本的近原样提取率
    • 3.71×Qwen2.5-14B在OpenMathInstruct上50条中毒样本相对良性微调的提取倍率
    • 6.07%Llama-3.1-8B在AceReason上100条中毒样本的直接提交近原样提取率
    6 问速览研究在黑盒输出设定下,能否通过向众包微调数据注入少量中毒样本放大提取其他用户的未知指令。
    1. 这篇论文试图解决什么问题?

      研究在黑盒输出设定下,能否通过向众包微调数据注入少量中毒样本放大提取其他用户的未知指令。

    2. 有哪些相关研究?

      涵盖预训练与微调数据提取、众包微调数据集构建,以及基于数据中毒的隐私推断与数据窃取攻击。

    3. 论文如何解决这个问题?

      构建领域主题锚点注入提取引导样本,并利用未微调代理模型的不确定性自适应筛选高收益锚点进行查询。

    4. 论文做了哪些实验?

      在 4 个模型与 2 个数据集上评估了直接提交与托管交互中毒,并测试了 4 种防御过滤方法及模型蒸馏效用。

    5. 有什么可以进一步探索的点?

      论文未专门讨论局限,其实验覆盖了 4 个开源模型、2 个核心数据集、4 种异常检测方法与多种预算配置。

    6. 总结一下论文的主要内容

      论文提出基于主题锚点的数据中毒攻击,证明低比例的中毒样本可在黑盒条件下隐蔽放大微调指令泄漏。

    完整解读
已经到底了