全部动态
从来源,看到研究的联系
点选节点,展开一条线索
本页材料
完整标题与摘要 · 24 条- 会议论文NeurIPS 2025
教得好学得坏:蒸馏条件式后门攻击
提出 DCBA:教师模型中的休眠后门在知识蒸馏后于学生模型中被激活,用双层优化方法 SCAR 实现,并能躲过现有后门检测。
- 会议论文NeurIPS 2025
通过排斥式视觉提示调优防御多模态后门模型
提出 RVPT,仅调 0.27% 参数并用特征排斥损失,将 CLIP 后门攻击成功率从 89.70% 降到 2.76%。
- 会议论文NeurIPS 2025
MIBP-Cert:基于混合整数双线性规划的抗数据扰动认证训练
针对训练数据错误、损坏与投毒攻击,用混合整数双线性规划计算可达参数集合,给出确定性的可证明鲁棒性,并适用于多种威胁模型。
- 会议论文NeurIPS 2025
ICLScan:通过定向上下文学习检测黑盒大语言模型中的后门
发现已含后门的 LLM 极易经 ICL 植入新触发器,据此仅靠多次查询统计成功率即可检测黑盒后门,各项指标接近 1。
- 会议论文NeurIPS 2025
水印、可迁移攻击与对抗防御的元分析
形式化基于后门的水印与对抗防御的权衡,证明任一学习任务中水印、对抗防御、可迁移攻击至少存在其一,并用全同态加密构造可迁移攻击。
- 会议论文NeurIPS 2025
ToxicTextCLIP:针对 CLIP 预训练的文本投毒与后门攻击
生成背景一致的对抗文本投毒 CLIP 预训练,投毒成功率最高 95.83%,后门 Hit@1 达 98.68%,并绕过多种防御。
- 会议论文NeurIPS 2025
对 LLM 的病毒感染攻击:投毒经合成数据传播
发现合成数据训练范式对现有投毒与后门攻击有较强抵抗力,提出 VIA 框架,使攻击即使在干净查询下也能经合成数据传播,下游攻击成功率接近上游。
- 会议论文NeurIPS 2025
SNEAKDOOR:针对分布匹配式数据集浓缩的隐蔽后门攻击
利用类决策边界的脆弱性,用生成模块构造与局部特征几何对齐的输入感知触发器,在保持攻击成功率与干净精度的同时显著提升合成数据与触发样本的隐蔽性。
- 会议论文NeurIPS 2025
联邦学习投毒攻击中的恶意客户端溯源
提出 FLForensics,在训练期防御失效、投毒模型已部署后,根据误分类的目标输入追溯恶意客户端,并给出理论保证,在五个数据集上对自适应攻击有效。
- 会议论文NeurIPS 2025
一个 token embedding 就能让大型推理模型陷入死锁
提出 Deadlock Attack,通过对抗 embedding 加后门植入诱发无限推理循环,在四个 LRM 上攻击成功率达 100%,且对正常输入影响很小。
- 会议论文NeurIPS 2025
BackdoorDM:扩散模型后门学习的综合基准
首个扩散模型后门基准,包含 9 种攻击、4 种防御和可视化工具,并提出基于 MLLM 的统一评测方法。
- 会议论文NeurIPS 2025
基于时序逻辑的多车后门攻击:针对端到端自动驾驶离线 RL 智能体
以其他车辆轨迹为触发器,用时序逻辑生成触发轨迹并加入负训练,在 5 个离线 RL 驾驶智能体上验证了攻击的灵活性与有效性。
- 会议论文NeurIPS 2025
RepGuard:大语言模型后门防御的自适应特征解耦
通过局部一致性与样本偏差定位可疑后门特征,并自适应掩码解耦,无需知道触发器;在目标拒答与越狱任务上平均将攻击成功率降低近 80%。
- 会议论文NeurIPS 2025
MLLM 微调中无需外部指导的后门清除
发现后门触发器会导致注意力塌缩,据此提出 BYE,用注意力熵无监督过滤后门样本,攻击成功率接近零且保持任务性能。
- 会议论文NeurIPS 2025
为数据投毒攻击提供可证明的水印
针对看似无害的数据投毒,提出投毒后与投毒并行两种可证明水印方案,在给定水印长度下同时保证可检测性与投毒效用。
- 会议论文NeurIPS 2025
协同样本选择与触发器的通用组件:高效的仅投毒干净标签后门攻击
提出一组可集成到多种干净标签后门攻击中的组件,通过协同选择样本与优化触发器,同时提升攻击成功率与隐蔽性。
- 会议论文NeurIPS 2025
BadVLA:通过目标解耦优化对视觉-语言-动作模型实施后门攻击
提出两阶段后门攻击,在多个 VLA 基准上攻击成功率近 100%,对干净任务影响很小,并对微调等扰动保持鲁棒。
- 会议论文NeurIPS 2025
BackdoorLLM:大语言模型后门攻击与防御综合基准
首个文本生成 LLM 后门基准,涵盖数据投毒、权重投毒、隐状态操纵和思维链劫持等攻击,含 200 余项实验与 7 种防御。
- 会议论文NeurIPS 2025
基于可逆剪枝掩码的后门缓解
提出带可逆剪枝掩码的双层优化方法,识别并剪除后门相关参数,在少量数据下优于现有剪枝式后门防御,并可比肩微调类方法。
- 会议论文NeurIPS 2025
Attack by Yourself:基于子图触发器池的多类别图后门攻击
用被攻击图自身的子图构建类别感知触发器池,实现有效且不易察觉的多类别 GNN 后门攻击,对多种模型与防御均有效。
- 会议论文NeurIPS 2025
谁为触发器发声?MoE Transformer 后门中的动态专家路由
提出 BadSwitch,利用 MoE 专家路由偏好植入后门,在三种 MoE 架构上攻击成功率最高达 100%,且保持干净准确率并抵御多种防御。
- 会议论文NeurIPS 2025
Lie Detector:基于交叉检验框架的统一后门检测
利用两个独立服务商模型间的不一致做交叉检验,以 CKA 度量特征相似性恢复触发器,在多种学习范式上提升检测精度,并首次覆盖多模态大模型。
- 会议论文IEEE S&P 2025
BAIT:通过反演攻击目标扫描大语言模型后门
- 会议论文USENIX Security 2025
LightShed:击破基于扰动的图像版权保护
提出通用去毒攻击,识别并去除 NightShade、Glaze 等保护扰动,检测 NightShade 的 TPR 达 99.98%,揭示现有保护方案的局限。