跳到正文

后门与投毒

今天还没有收录新动态
10月6日周二
  1. 论文追踪 · 收录 · 原文 论文40

    研究者提出临时可见性协议,限制持续摄入 RAG 向量库的投毒暴露

    研究者提出一种失败即关闭的临时可见性协议,用于控制持续摄入场景下 RAG 向量库的投毒暴露:新内容在截止期限内以临时状态准入,验证未及时完成的内容被隐藏,并支持按血缘范围隔离。在五组编码自然语言文档负载上,使用精确后端与 Milvus 评测,验证器积压时该截止机制把投毒检索的中位数从 34(29–34)降到 7(6–7),被挤出的干净结果数量同步下降。先验证后可见可避免临时暴露,但干净内容首次可见延迟到 6.3 秒,而临时准入可在 3 毫秒内可见,代价是过期干净条目可能出现临时可用性缺口。用特定检测器回放决策显示,误放行会让投毒内容保持可见,误拒答则会把干净内容排除在检索之外,说明协议保证与检测器质量各自决定哪些结果。该工作已被 IEEE CBDCom 2026 接收。

10月4日周日
  1. 论文追踪 · 收录 · 原文 论文54

    上海交大等提出 trait-direction drift 机制与探针空间走廊正则,抑制蒸馏中的潜隐特质迁移

    上海交通大学与上海人工智能实验室等机构的研究者提出 trait-direction drift 机制,解释模型蒸馏中潜隐学习如何发生:带偏置系统提示词的教师模型生成数字序列等语义干净的数据,其序列级偏好差距在期望上为正,学生可识别的差距在监督微调中累积成沿特质方向的漂移,进而产生行为迁移。基于该机制,作者提出探针空间走廊正则(probe-space corridor regularization),在蒸馏过程中约束沿校准特质方向的漂移。实验显示,该方法把恶意回复迁移率从 29.55% 降至 6.45%,主任务准确率损失很小,并在 Qwen 设置下持续抑制动物偏好迁移;Llama 设置中猫头鹰偏好从 17.8% 降至 0.6%。跨模型迁移在目标学生排序后仍明显弱于同模型设置,作者通过诊断与干预实验分析了这一衰减。

    推荐理由论文把潜隐学习拆成偏好差距、SFT 更新累积与行为迁移三段,并给出可约束漂移的训练期正则方法。

  2. 论文追踪 · 收录 · 原文 论文48

    研究测量 LLM Agent 记忆投毒防御的良性场景开销

    研究者搭建统一测量装置,在记忆后端、检索流程和评判模型保持一致的前提下,只改变防御本身,评估 LLM Agent 记忆投毒防御在完全良性流量下的效用损失与 token 开销。测试覆盖三种写入时防御(输入清洗、来源检查、基于 LLM 的异常检测)和一种读取时防御(重排序),每种条件在五段对话上重复三次,以区分真实效应与流水线噪声。写入时防御未显示出可分辨的效用损失,95% 置信区间约为正负 4.5 个百分点并包含零。重排序器则使核心准确率下降 4.4 个百分点(95% CI [-9.0,-0.05],bootstrap;McNemar p=0.064),该结果可复现但处于测量分辨率边缘;在无攻击对话中,它隔离了 33.6% 的合法记忆条目,单段对话最多出现 106 次误隔离,token 开销为 2.7%。研究认为,决定防御良性场景代价的是它拦截流水线的位置,而非是否使用 LLM。

10月3日周六
  1. arXiv · 收录 · 原文 论文48

    修正而非删除:用纠正性监督缓解涌现性失准

    研究者在 Qwen2.5-14B-Instruct 上微调混合了不良医疗建议与良性对话数据,发现把预先选定的四分之一投毒样本替换为同一提示的纠正答案,可将涌现性失准(EM)率降低约三分之一,并改善留出医疗问题的回答,而删除同样这些样本几乎没有可测效果。修正一半投毒样本时优势更大,且在第二个基座模型和第二个失准模型上同样成立。替换内容本身似乎重要:保留不良建议的改写没有明显收益,而数据集中自带的正确答案与作者改写器的效果相当。在已中毒模型上继续微调时,用纠正样本做短轮训练优于等量通用对话数据,对其他医疗提示的纠正与对投毒提示本身的纠正效果相近,要求改写者模仿谨慎、避免伤害的助手也没有额外收益。

  2. arXiv · 收录 · 原文 论文27

    VaccineBooster:面向有害微调对齐的混合扰动防御

    VaccineBooster 将嵌入向量扰动与权重级梯度衰减合并进单次对齐训练步骤,用于抵御微调即服务中的有害微调攻击。在 Llama-2-7B 上经 BeaverTails 对齐并遭投毒微调攻击后,其 OpenAI moderation 得分为 0.315,为所比较防御中最低;仅用 Booster 的变体则保持最高 50% 的攻击后拒答率。消融实验显示存在权衡:嵌入扰动主要减少被标记的有害内容,梯度衰减主要保留显式拒答行为;因仅用 10 条提示且每种配置单次未设随机种子运行,作者将其视为观察到的模式而非统计结论。

10月2日周五
  1. arXiv · 收录 · 原文 论文42

    DeBERTa-ConPara:面向部署的 AI 生成文本检测,推理端 Unicode 归一化提升对抗鲁棒性

    研究者提出 DeBERTa-ConPara,一个面向部署的 AI 生成文本检测器,将攻击感知的 Unicode 预处理与基于 HC3 Plus、M4、MAGE 和 RAID 训练的上下文 Transformer 编码器结合。核心发现是预处理方向相反:对训练语料做归一化会去重,把 35.4% 的 RAID 行折叠成其干净样本的副本并删除对抗监督,而在推理端归一化则是有效防御。独立变化两种放置方式的析因实验显示,原始训练加归一化推理是最佳配置,在官方 RAID 隐藏测试上达到 99.61% AUROC、99.01% TPR@5% FPR 和 96.57% TPR@1% FPR,在固定阈值下于 HC3 Plus 和 MAGE 上平均平衡准确率为 93.14%。增益仅集中在十二类攻击中的两类:同形字和零宽空格插入从 11.05% 和 1.12% 提升到 96.98%。

  2. arXiv:后门、投毒与隐私 · 收录 · 原文 论文33

    SAGE:基于相似度从少量已验证样本中清洗中毒训练数据

    针对数据投毒防御普遍依赖大量可信干净样本的问题,研究者提出 SAGE——在一个独立数据集上训练通用特征提取器,再用基于少量已验证样本的非参数化相似度加权预测标记中毒训练样本。该方法只需极少数经取证专家核查过(无论判定为干净还是有毒)的样本即可生效,并在七个 clean-label 攻击方法的基准上与现有防御对比取得优势。实验还发现,已验证干净样本在各类别间的分布比其总数更重要。

  3. arXiv:后门、投毒与隐私 · 收录 · 原文 论文50

    研究者提出用零空间投影净化 LoRA 微调 LLM 的后门

    研究者提出一种针对 LoRA 微调大语言模型的后门净化方法,通过零空间投影将攻击成功率从接近 100% 降至 10% 以下。该方法不依赖触发器先验知识、干净参考模型或对可疑参数的重新训练,而是通过数据整理与特征近似提取高保真后门方向,在每一层或每个注意力头的输入与输出通道上构造正交零空间,再将 LoRA 更新投影到该空间。作者通过一系列消融实验,将方法从文本分类的单层设置逐步扩展到生成任务的全参数 LLM,并称在降低攻击成功率的同时保留了基座模型的通用能力和适配器学到的下游技能。

  4. arXiv:后门、投毒与隐私 · 收录 · 原文 论文48

    NEEDLE:通过权重正交化移除 LLM 后门

    研究者提出 NEEDLE,一种免训练的后门定向移除方法。该方法在识别出触发词后,通过激活向量估计后门方向和拒答子空间,再依次施加权重正交化,在压制后门的同时避免改变与拒答相关的表征。NEEDLE 不需要干净参考模型,也不需要原始被投毒的训练数据。在多个模型族和多种攻击类型上的评测中,NEEDLE 取得所评估防御方法中最低的平均攻击成功率,在代码注入类攻击上为 0%,同时 KL 散度最低,能力与安全性的变化也最小。

10月1日周四
  1. arXiv · 收录 · 原文 论文41

    DataShield:通过共识子空间对齐识别 LLM 微调中的高风险数据

    DataShield 是一个数据评估框架,通过多个安全对齐 LLM 构建的联合安全关键语义空间中的共识子空间对齐,识别有风险的微调样本和回复片段。该框架在这些空间内用语义谱分解提取共识的安全与不安全子空间,再通过衡量样本或片段与不安全子空间、安全子空间的相对对齐程度估计风险,从而支持样本级过滤和细粒度片段级掩码。与现有过滤和掩码基线相比,DataShield 在样本过滤下将 ASR 降低 14.6%,在片段掩码下降低 32.3%,同时保持下游效用,并避免针对特定目标模型计算风险。

  2. arXiv:后门、投毒与隐私 · 收录 · 原文 论文15

    MROP:针对 Deep JSCC 后门攻击的掩码区域优化净化方法

    针对 Deep JSCC 图像传输中的输入补丁后门攻击,研究者提出掩码区域优化净化(MROP)。该方法在推理阶段于编码器输入端放置逐像素掩码,通过 Gumbel-sigmoid 松弛优化定位触发补丁并细化触发区域,无需重新训练 JSCC 模型。在 CIFAR-10 和 STL-10 数据集及 DeepJSCC、SwinJSCC 模型上,MROP 大幅降低攻击成功率(ASR),同时保持干净重建的峰值信噪比(PSNR)。

  3. arXiv:后门、投毒与隐私 · 收录 · 原文 论文40

    NDDL:用正常扩散动力学为文生图模型做后门防御

    研究者提出 Normal Diffusion Dynamics Learning(NDDL),一种仅用正常样本训练的文生图扩散模型后门防御框架。该方法观察到正常扩散轨迹在 cross-attention、潜空间和噪声空间中呈现结构化且随 timestep 变化的转移模式,而后门攻击会使其偏离这种正常演化。NDDL 构建紧凑的多空间轨迹表示,训练一个以 timestep 为条件的动力学模型来预测扩散演化,推理时用观测转移与预测转移之间的偏差量化动力学不一致性以检测后门。该框架还能在无需任何后门先验知识的情况下,通过低语义词替换实现触发器定位。多种后门攻击上的实验显示其有效性与泛化性。

  4. arXiv · 收录 · 原文 论文43

    RACER:面向多模态大模型后门的区域感知一致性修复框架

    论文提出 RACER,一个模型级的多模态大模型后门修复框架,通过抑制内部表征的层级不一致异常来从源头移除后门。作者观察到后门会在内部表征中引发层级间演化异常,即层级不一致异常,且该异常与模态相关,主要集中在编码触发特征的 token 区域。RACER 据此把融合表征拆分为视觉与文本 token 区域,分别归一化其层级不一致性,再在深层窗口内以模态感知权重重组,形成区域感知的不一致目标,并通过 min-max 优化合成最坏情况扰动、对扰动做对抗微调来修复模型。该方法只需 100 条干净样本,不需要知道触发器、攻击目标,甚至不需要知道输入模型是否含后门。

  5. arXiv:后门、投毒与隐私 · 收录 · 原文 论文15

    DP-BR-FedAvg:面向银行与医疗的差分隐私拜占庭鲁棒联邦学习框架

    针对联邦学习中参数更新泄露隐私与恶意客户端投毒两大问题,研究者提出 DP-BR-FedAvg 框架,将高斯机制差分隐私层与逐坐标截断均值拜占庭鲁棒聚合规则结合,在模拟跨机构欺诈与临床风险评分任务上评估。在 20 个客户端、其中四分之一为拜占庭节点、共 60 轮通信的设置下,FedAvg 在少数类上崩溃(F1 仅 0.030),该框架恢复至 F1 0.119,同时限制单个客户端贡献的隐私损失。无隐私层的拜占庭鲁棒聚合器原始准确率最高,量化了隐私对鲁棒性的代价,表明两类机制是相互作用而非简单叠加。

  6. arXiv:后门、投毒与隐私 · 收录 · 原文 论文37

    TRIM:面向多种后门触发器的黑盒检测与净化方法

    研究者提出 TRIM(Trigger Removal by Identifying Manipulated Regions),一种面向部署的黑盒后门防御方法,可在推理时检测并选择性移除后门触发器,无需模型内部信息、训练数据或干净样本。TRIM 通过基于区域的分割与深度特征表示、结合 inpainting 和扩散模型重建的自适应触发器发现,以及选择性区域净化三个组件,在不假设触发器类型、形状或位置的前提下定位导致误分类的区域并只净化这些区域。为便于部署,TRIM 还缓存已识别触发器的特征嵌入,避免重复检测与净化。

  7. arXiv:后门、投毒与隐私 · 收录 · 原文 论文39

    FedMAST:用多轴结构痕迹检测并遏制联邦学习后门

    作者提出 FedMAST,一种面向联邦学习的多轴结构痕迹后门检测与遏制防御,对客户端提交的更新从结构、谱和历史三类互补证据打分,再做分层过滤与轮级遏制。方法引入 squeeze-pair 一致性评分以暴露耦合特征畸变,并用带符号的谱漂移跟踪捕捉持续的方向性变化。在六种后门攻击、九组对比中,FedMAST 的攻击成功率均低于基线,完整 200 轮运行平均 ASR 为 1.51%、主任务准确率 94.84%。

  8. arXiv:后门、投毒与隐私 · 收录 · 原文 论文29

    面向后门攻击下持续学习的鲁棒动态扩展:净化与选择性恢复

    针对增量任务中混入少量后门投毒样本的持续学习场景(CLUBA),研究者提出一个融合样本净化、选择性恢复与鲁棒专家路由的动态扩展框架。其中 Bi-Prototype Purification(BPP)利用特征空间语义差异识别可疑样本,Gradient Discrepancy-based Robustness Optimization(GDBRO)通过伪标签纠正与梯度一致性评估选择性恢复含信息量的投毒样本,Robust Feature Consistency-based Expert Selection(RFCBES)构建扰动感知类原型以支持受损输入下的专家路由。该工作旨在同时缓解灾难性遗忘、保持适应能力并阻止模型吸收恶意监督。

  9. arXiv:后门、投毒与隐私 · 收录 · 原文 论文22

    VERITAS:抗投毒的本地差分隐私图学习协议

    针对本地差分隐私(LDP)图学习协议易受数据投毒攻击的问题,研究者提出抗投毒协议 VERITAS,采用"信任但验证"范式。该协议在用户侧引入编码分级信任等级的验证列表,对节点特征与图结构联合私有化,并在服务端利用双向证明不对称性识别和剪除恶意节点,流程包括本地数据扰动、证明驱动的恶意节点剪枝、双重去噪恢复效用和鲁棒隐私图学习四个阶段。在四个真实基准数据集、多种 LDP 机制与 GNN 架构上的实验显示,VERITAS 能有效防御数据投毒攻击,并在严格隐私保证下显著提升下游图学习效用。

  10. arXiv:后门、投毒与隐私 · 收录 · 原文 论文15

    基于神经形态时序嵌入与混合 SNN-XGBoost 的工业信息物理系统鲁棒分类:面向机器遗忘攻击

    研究提出一种混合 SNN 与 XGBoost 架构,用脉冲神经网络做固定时序特征提取器、仅重训 XGBoost 分类器,以提升电力系统入侵检测对机器遗忘攻击的鲁棒性。在两个真实电力系统数据集上,Synchrophasor 达 99.9% 准确率(F1-macro 0.999),MSU/ORNL 达 95.0% 准确率(F1-macro 0.943)。在选择性标签翻转攻击下,10% 投毒时 F1-macro 仅下降 0.9%,目标类崩溃阈值从 60% 投毒推迟到 70%。

  11. arXiv:后门、投毒与隐私 · 收录 · 原文 论文43

    研究重新审视后门修复评测:区分总体干净效用与良性性能保持

    论文提出后门修复评测不应只看攻击成功率(ASR)和总体干净准确率,因为总体准确率会掩盖集中在部分标签空间上的性能退化。作者从保持视角区分总体干净效用与原有类别性能的保持,通过比较修复前后的干净性能定义类别级保持损失,并指出聚合会通过局部损失稀释和跨类别补偿隐藏局部退化。为此论文引入最差类别保持损失和尾部保持损失来刻画局部保持损失,并在代表性后门攻击、修复方法、数据集、攻击目标和模型架构上开展系统实证研究,另在干净标签攻击下做了验证。结果显示,有效抑制攻击和良好的总体干净性能并不必然意味着各类别原有良性性能被均匀保持,修复后仍可能存在明显的局部保持损失,其严重程度和类别结构随修复条件变化。

  12. arXiv:后门、投毒与隐私 · 收录 · 原文 论文25

    ODPure:通过集成破坏共识实现目标检测后门净化

    ODPure 是一种面向目标检测的输入阶段黑盒后门防御方法,通过破坏-重建-选择(CRS)范式净化输入,无需丢弃恶意数据或模型即可维持稳定的感知流。该方法利用多种破坏方式中和触发器、生成大量冗余候选框,再借助生成先验恢复细粒度结构线索,最后通过投票对检测结果达成共识。实验表明,ODPure 能抵御多种后门攻击与触发器类型,同时保持基线精度。

  13. arXiv:后门、投毒与隐私 · 收录 · 原文 论文32

    CLIPGuard:针对 CLIP 嵌入空间隐蔽后门的区域级黑盒防御

    CLIPGuard 是一种轻量、完全黑盒的防御方法,通过测量分段嵌入扰动定位恶意区域,并仅对可疑片段做语义修复,以抵御 CLIP 嵌入空间后门攻击。在 STL-10、ImageNet 及 BadCLIP、BadNets、blended、patch-based、typographic 等触发家族上,该方法将攻击成功率降至最低 1.05%,干净准确率最高保持 86.34%,持续优于 CleanCLIP 和 CleanerCLIP 等黑盒防御。

  14. arXiv:Agent 与 MCP 安全 · 收录 · 原文 论文43

    研究者提出面向工具集成 LLM Agent 的通用对抗攻击防御方法

    研究者提出一套统一框架下的通用防御策略,用于应对工具集成 LLM Agent 面临的直接提示注入、间接提示注入、记忆投毒和后门攻击四类对抗攻击。方法包含两类基于工具的防御:Attacker Tool Filtering 用异常检测(如 Isolation Forest)识别并移除可疑工具,Normal Tool Recalling 则在规划前以白盒方式恢复 Agent 的原始工具集;同时引入 Chain-of-Thought 提示与自我反思等基于提示的防御,并通过任务改写缓解攻击。

9月30日周三
  1. arXiv:后门、投毒与隐私 · 收录 · 原文 论文35

    物理认证联邦学习:为关键水务基础设施的协同异常检测提供安全保障

    研究提出"物理认证联邦学习",将守恒定律、执行器耦合等信息物理过程不变量从运行时检测启发式改造为联邦更新的可验证准入条件,自动从干净运行数据中挖掘。在 SWaT、WADI 两个水务测试床和 BATADAL 基准上,挖掘出的不变量对 100 个诚实分片零拒绝,并全部拒绝朴素伪造更新,包括 FoolsGold 完全放行的优化扰动。

已经到底了