跳到正文

后门与投毒

数据投毒、后门与潜伏行为:植入、检测与清除。

118条动态与论文相关主题越狱与攻击开源模型安全防御与护栏
在这个话题内搜索或按分类筛选

新闻与论文

第 61–80 条 · 共 118 条
10月1日周四
  1. arXiv:后门、投毒与隐私 · 收录 · 原文 论文25

    去中心化联邦学习中的拜占庭节点放置优化

    去中心化联邦学习(DFL)的安全评估通常关注拜占庭参与者如何行动,却忽视了哪些参与者被攻陷。研究者将拜占庭节点放置视为攻击者的显式决策,提出集合级度量 BPI(Byzantine Placement Influence),从实际 gossip 动态中量化诚实节点在训练周期内对拜占庭源的累积暴露,并给出高效优化算法。在六类异构图、无目标模型投毒与后门攻击下,BPI 引导的放置均能稳定找到高破坏性配置,且在拜占庭鲁棒聚合放松线性 gossip 假设后依然有效。

  2. arXiv:后门、投毒与隐私 · 收录 · 原文 论文46

    研究揭示针对 LLM 驱动机器人系统的内部状态触发后门攻击

    论文首次系统研究针对 LLM 驱动机器人系统的基于历史的后门攻击,攻击者通过操纵指令在基于 LLM 的机器人控制器中植入隐蔽后门。该后门不由外部线索触发,而是由机器人自身过去动作的特定罕见序列激活,在正常运行中保持休眠以维持机器人效用,激活后可诱导完全停止或碰撞等恶意行为。在多种机器人和 LLM 的仿真环境实验中,该攻击达到近乎完美的攻击成功率,同时极难被检测。研究指出这是自主系统中此前未被解决的关键漏洞,强调安全措施需考虑智能体的内部状态。

  3. arXiv:后门、投毒与隐私 · 收录 · 原文 论文50

    GhostWord:针对自动语音识别的细粒度后门攻击

    研究者提出 GhostWord,一种词级、时间定位的自动语音识别(ASR)后门攻击,用码本把约 400 毫秒的短音频触发词映射到目标词。投毒时把触发词注入选定源词在强制对齐时间跨度内的音频,并只替换转写中的该词,从而实现精确的语义翻转和可组合的句子操纵,避免多对一标签痕迹。在 Common Voice(v23 英语、v24 立陶宛语)和 Whisper-Small/Medium、MMS、SpeechT5 多个骨干上,平均攻击成功率为 89.3%,并可跨语言、跨模型迁移。

  4. arXiv:后门、投毒与隐私 · 收录 · 原文 论文15

    联邦学习中的隐私泄露:车载边缘网络惯性感知下基于梯度的客户端身份推断与防御

    在车载边缘网络中,诚实但好奇的服务器可从联邦学习客户端上传的权重增量中近乎完美地推断客户端身份,在 UCI HAR 基准上五种攻击分类器、五种非 IID 划分下攻击准确率约 1.000。研究评估了固定裁剪 C=1.0 下扫描高斯噪声的轻量“先裁剪再加噪”防御,sigma 在 [0.1, 0.2] 区间可将攻击准确率压至接近随机,而 FL 精度相对损失低于 5%,并通过 Renyi 记账给出 (epsilon, delta)-DP 预算。集成 FL 以 1/K 匿名集上界提供结构性隐私且无噪声代价;HAR 被明确定位为车载 IMU 数据的代理基准。

  5. arXiv:后门、投毒与隐私 · 收录 · 原文 论文15

    DP-BR-FedAvg:面向银行与医疗的差分隐私拜占庭鲁棒联邦学习框架

    针对联邦学习中参数更新泄露隐私与恶意客户端投毒两大问题,研究者提出 DP-BR-FedAvg 框架,将高斯机制差分隐私层与逐坐标截断均值拜占庭鲁棒聚合规则结合,在模拟跨机构欺诈与临床风险评分任务上评估。在 20 个客户端、其中四分之一为拜占庭节点、共 60 轮通信的设置下,FedAvg 在少数类上崩溃(F1 仅 0.030),该框架恢复至 F1 0.119,同时限制单个客户端贡献的隐私损失。无隐私层的拜占庭鲁棒聚合器原始准确率最高,量化了隐私对鲁棒性的代价,表明两类机制是相互作用而非简单叠加。

  6. arXiv:后门、投毒与隐私 · 收录 · 原文 论文37

    TRIM:面向多种后门触发器的黑盒检测与净化方法

    研究者提出 TRIM(Trigger Removal by Identifying Manipulated Regions),一种面向部署的黑盒后门防御方法,可在推理时检测并选择性移除后门触发器,无需模型内部信息、训练数据或干净样本。TRIM 通过基于区域的分割与深度特征表示、结合 inpainting 和扩散模型重建的自适应触发器发现,以及选择性区域净化三个组件,在不假设触发器类型、形状或位置的前提下定位导致误分类的区域并只净化这些区域。为便于部署,TRIM 还缓存已识别触发器的特征嵌入,避免重复检测与净化。

  7. arXiv:后门、投毒与隐私 · 收录 · 原文 论文24

    利用不完美修复实现数据可用性攻击:IRP 投毒方法

    针对现有数据可用性攻击(DAA)难以同时兼顾监督学习(SL)与自监督学习(SSL)的问题,研究者对基于卷积的不可学习数据集 CUDA 进行理论分析,指出其引入次优梯度并以类别偏置实现投毒。据此提出新投毒方法 Imperfect Restoration Poisoning(IRP),在保持高图像质量的同时实现强投毒效果。在 SL 与 SSL 下与 8 个基线方法对比,并与 5 种代表性防御方法评估,IRP 均表现更优。

  8. arXiv:后门、投毒与隐私 · 收录 · 原文 论文39

    FedMAST:用多轴结构痕迹检测并遏制联邦学习后门

    作者提出 FedMAST,一种面向联邦学习的多轴结构痕迹后门检测与遏制防御,对客户端提交的更新从结构、谱和历史三类互补证据打分,再做分层过滤与轮级遏制。方法引入 squeeze-pair 一致性评分以暴露耦合特征畸变,并用带符号的谱漂移跟踪捕捉持续的方向性变化。在六种后门攻击、九组对比中,FedMAST 的攻击成功率均低于基线,完整 200 轮运行平均 ASR 为 1.51%、主任务准确率 94.84%。

  9. arXiv · 收录 · 原文 论文50

    DnD:面向检索增强生成的多样化分布式投毒攻击

    研究者提出 DnD(Divide and Doubt),一种针对检索增强生成(RAG)的定向语料投毒攻击,通过把对目标答案的支持分散到风格多样的段落中,并加入一段质疑参考答案证据的段落来提升攻击效果。分散化让投毒段落在嵌入向量空间中更分散,质疑段落则在多条投毒段落被检索到时增强目标答案被采纳的概率。作者在两个开放域问答数据集、三个 LLM 和九种 RAG 配置上,分别在检索器黑盒与白盒条件下评测,DnD 在多数配置中达到或超过此前的攻击方法,对基于聚类和冲突感知的防御提升最明显。论文编号 arXiv:2609.27090,属 cs.CR 方向。

  10. arXiv:后门、投毒与隐私 · 收录 · 原文 论文29

    面向后门攻击下持续学习的鲁棒动态扩展:净化与选择性恢复

    针对增量任务中混入少量后门投毒样本的持续学习场景(CLUBA),研究者提出一个融合样本净化、选择性恢复与鲁棒专家路由的动态扩展框架。其中 Bi-Prototype Purification(BPP)利用特征空间语义差异识别可疑样本,Gradient Discrepancy-based Robustness Optimization(GDBRO)通过伪标签纠正与梯度一致性评估选择性恢复含信息量的投毒样本,Robust Feature Consistency-based Expert Selection(RFCBES)构建扰动感知类原型以支持受损输入下的专家路由。该工作旨在同时缓解灾难性遗忘、保持适应能力并阻止模型吸收恶意监督。

  11. arXiv:后门、投毒与隐私 · 收录 · 原文 论文43

    FreqDoor:面向视觉语言模型的频域后门攻击

    研究者提出 FreqDoor,一种在频域植入触发器的训练期后门攻击,针对视觉语言模型。该方法选择性混合触发源图像的幅度谱分量,同时保留干净图像的相位,从而生成空间分布且视觉上难以察觉的触发器,且不修改文本输入。在 BLIP-2、InstructBLIP 和 LLaVA 上评估图像描述与视觉问答任务,在 Flickr8k 上三个模型的攻击成功率分别为 99.6%、99.8% 和 98.4%,同时保持生成描述的语义质量;在 VQAv2 上对应攻击成功率为 99.6%、92.4% 和 79.6%。

  12. arXiv:后门、投毒与隐私 · 收录 · 原文 论文22

    VERITAS:抗投毒的本地差分隐私图学习协议

    针对本地差分隐私(LDP)图学习协议易受数据投毒攻击的问题,研究者提出抗投毒协议 VERITAS,采用"信任但验证"范式。该协议在用户侧引入编码分级信任等级的验证列表,对节点特征与图结构联合私有化,并在服务端利用双向证明不对称性识别和剪除恶意节点,流程包括本地数据扰动、证明驱动的恶意节点剪枝、双重去噪恢复效用和鲁棒隐私图学习四个阶段。在四个真实基准数据集、多种 LDP 机制与 GNN 架构上的实验显示,VERITAS 能有效防御数据投毒攻击,并在严格隐私保证下显著提升下游图学习效用。

  13. arXiv:后门、投毒与隐私 · 收录 · 原文 论文26

    FDBA:联邦学习中的细粒度分布式后门攻击

    研究者提出细粒度分布式后门攻击框架 FDBA,用动态触发器生成与嵌入向量优化,在更少投毒样本下实施攻击。该方法基于 Canny 算法提取图像边缘特征并注入 Laplacian 噪声,再经 RGB 通道分解隐藏分布式触发器,同时用嵌入向量对比学习把投毒样本拉向目标类中心。在 CIFAR-10 上,目标 ASR 介于 70% 至 90% 时,FDBA 相比 DBA 减少 37.4%–48.4% 的投毒比例;Non-IID 极端异构下保留 84.7% 的 IID 攻击性能,DBA 降至 73.5%,并能绕过主流防御机制。

  14. arXiv · 收录 · 原文 论文55

    TrojanWorld:通过想象引导对世界模型智能体植入后门

    研究者提出 TrojanWorld,一种针对世界模型智能体的供应链后门框架,通过引导模型内部想象而非改动决策模块来诱发攻击者指定的行为。攻击以场景中放置的物理物体作为触发器,经智能体原生观测管线激活,无需数字篡改观测流。框架由三项机制组成:Decision-Reflective Induction 利用决策反馈将触发条件下的想象导向目标动作,Clean Behavior Anchoring 保持无触发时的预测与行为保真度,Causal Propagation 在触发器消失后沿后续轨迹延续被诱导的偏好。研究还测试了 Fine-Pruning、SHINE 和 Neural Cleanse 三种防御的适配版本,没有一种能在保持干净效用的同时完全移除攻击。

    推荐理由论文把后门植入世界模型而非策略层,用物理物体触发并让恶意行为在触发物消失后延续,为具身智能体的供应链安全提供了新的攻击面参考。

  15. arXiv:后门、投毒与隐私 · 收录 · 原文 论文15

    基于神经形态时序嵌入与混合 SNN-XGBoost 的工业信息物理系统鲁棒分类:面向机器遗忘攻击

    研究提出一种混合 SNN 与 XGBoost 架构,用脉冲神经网络做固定时序特征提取器、仅重训 XGBoost 分类器,以提升电力系统入侵检测对机器遗忘攻击的鲁棒性。在两个真实电力系统数据集上,Synchrophasor 达 99.9% 准确率(F1-macro 0.999),MSU/ORNL 达 95.0% 准确率(F1-macro 0.943)。在选择性标签翻转攻击下,10% 投毒时 F1-macro 仅下降 0.9%,目标类崩溃阈值从 60% 投毒推迟到 70%。

  16. arXiv:后门、投毒与隐私 · 收录 · 原文 论文13

    监督学习中的数据投毒攻击实证评估:标签翻转与后门投毒在 MNIST 和 Fashion-MNIST 上的对比

    研究在 MNIST 和 Fashion-MNIST 上评估了标签翻转与后门投毒两类训练时攻击,对比 Logistic Regression、Linear SVM 和 Random Forest 三种基线分类器,投毒率设为 5%、10% 和 20%。标签翻转导致明显性能下降,Logistic Regression 和 Linear SVM 受影响最大,Random Forest 相对稳定;后门投毒在全部数据集和模型上攻击成功率达 0.9667 至 1.0000,且干净测试性能常接近基线。结果表明无差别投毒会体现在常规指标中,而定向后门投毒更具隐蔽性,需采用面向安全的评估方法。

  17. arXiv:后门、投毒与隐私 · 收录 · 原文 论文46

    SALVE:用文本优化还原蒸馏数据中的隐性学习效应

    研究者提出 SALVE(Search-Aided Latent Verbalization),通过优化 soft prompt、让同一模型将其转写为文本并用 beam search 提升可靠性,把蒸馏数据中不可读的隐性学习效应还原为可读提示词。作者指出,带提示词的隐性学习是上下文蒸馏的一个特例,理论上该数据集可识别出教师的提示词,于是把提示词还原转化为文本优化问题。在标准隐性学习设定下,SALVE 能稳定还原出点明教师特质的可读提示词,而常见文本优化方法做不到。研究还发现,在隐性学习失效的某些设定下 SALVE 仍能从数据集中还原教师特质,而调整学生训练以改善上下文蒸馏则可能产生隐性学习效应。

  18. arXiv:后门、投毒与隐私 · 收录 · 原文 论文43

    UBA-ORL:针对离线强化学习的遗忘激活后门攻击

    研究者提出 UBA-ORL,一种针对离线强化学习的遗忘激活后门攻击:攻击在正常训练后被大幅抑制,却在合规驱动的数据删除(遗忘)请求后显现。该方法采用双样本机制,同时注入后门轨迹(BD)与伪装轨迹(CM),两者共享同一触发模式,但 CM 保留良性动作并配以同样高的奖励。训练时 BD 与 CM 提供相互竞争的监督信号,当对 CM 子集发起合法删除请求后,残留的 BD 信号重新占据主导,按需重新激活后门。实验显示 UBA-ORL 在评测的离线 RL 配置下实现可控激活,无触发回报的变化因配置而异,暴露出合规驱动离线 RL 平台此前被忽视的安全风险。作者呼吁社区为合规遗忘服务开发遗忘前与遗忘后的联合审计机制。

  19. arXiv:后门、投毒与隐私 · 收录 · 原文 论文43

    研究重新审视后门修复评测:区分总体干净效用与良性性能保持

    论文提出后门修复评测不应只看攻击成功率(ASR)和总体干净准确率,因为总体准确率会掩盖集中在部分标签空间上的性能退化。作者从保持视角区分总体干净效用与原有类别性能的保持,通过比较修复前后的干净性能定义类别级保持损失,并指出聚合会通过局部损失稀释和跨类别补偿隐藏局部退化。为此论文引入最差类别保持损失和尾部保持损失来刻画局部保持损失,并在代表性后门攻击、修复方法、数据集、攻击目标和模型架构上开展系统实证研究,另在干净标签攻击下做了验证。结果显示,有效抑制攻击和良好的总体干净性能并不必然意味着各类别原有良性性能被均匀保持,修复后仍可能存在明显的局部保持损失,其严重程度和类别结构随修复条件变化。

  20. arXiv:后门、投毒与隐私 · 收录 · 原文 论文43

    研究者在 FANUC 与 xArm 工业机械臂上实测后门攻击与防御

    作者对基于学习的工业机械臂操作开展后门攻击与防御的初步实证研究,实验平台为 FANUC 和 xArm 两台真实商用工业机械臂。研究考察后门能否在正常任务执行时保持隐蔽、仅在特定触发器出现时诱发出语义错误的操作行为。作者随后开发了一套在线防御流程,在运行时检测并中和触发器,并与离线微调防御进行效果对比。研究还评估了该防御流程引入的计算延迟与执行开销,以判断其是否适合高吞吐工业场景。该工作已被 IROS 2026 Workshop on Industrial Applications of Robot Learning 接收。