全部动态
从来源,看到研究的联系
点选节点,展开一条线索
本页材料
完整标题与摘要 · 24 条- 会议论文ICML 2026
BYORn:自举自身响应以防御大型视觉语言模型的后门攻击
识别微调中语义不合理的投毒响应并替换为模型自生成响应,提升后门鲁棒性且不损害干净任务表现,对自适应攻击也有效。
- 会议论文ICML 2026
图神经网络抵御标签与结构投毒的可认证防御
针对图数据投毒认证难题,提出半监督自训练图划分聚合框架ST-GPA,通过伪标签与合成边有效实现了稀疏条件下抵御节点标签和图结构投毒的可认证鲁棒性。
- 会议论文ICML 2026
从内部诊断到外部审计:VLM 驱动的无数据在线后门防御
提出 PRISM,用通用 VLM 作为独立外部审计者,通过在线测试时自适应实现无数据后门防御,在 17 个数据集、11 种攻击上 CIFAR-10 攻击成功率降至 1% 以下。
- 会议论文ICML 2026
通过类别子空间正交化提升后门检测器灵敏度
提出类别子空间正交化方法,在优化检测统计量时抑制目标类的固有特征,消除非目标类的干扰,即插即用提升了多种检测器应对后门与投毒攻击的灵敏度。
- 会议论文ICML 2026
从中毒到觉察:培养 LLM 的后门自我觉察
用反演式强化学习让中毒模型自述其植入触发词,并据此提出缓解与检测两种防御,在五种后门攻击上优于六个基线。
- 会议论文ICML 2026
双分支鲁棒不可学习样本
提出双分支不可学习扰动优化方法DUNE,在空间域和颜色域分别优化扰动并引入模型集成,在7种主流防御下保持对模型训练的破坏效果,显著降低测试准确率。
- 会议论文ICML 2026
VENOMREC:多模态 LLM 推荐系统中面向定向推广的跨模态交互投毒
利用跨模态融合构造协同的 token 与图像块扰动,在微调中把融合表示引向目标,四个数据集上平均 ER@20 为 0.73,且推荐效用基本不变。
- 会议论文ICML 2026
从参数到特征空间:模型合并中消除后门任务算术
针对模型合并易受后门攻击的问题,该研究从特征空间跨任务线性视角提出LFPM框架,引入抗后门任务向量并在插值路径上抑制后门,同时保持正常性能。
- 会议论文ICML 2026
Eyes-on-Me:基于注意力吸引子的可扩展RAG投毒攻击
提出Eyes-on-Me,通过注意力吸引子引导模型关注恶意内容,在18种RAG设置下将投毒成功率提升至57.8%,且具跨模型黑盒迁移性。
- 会议论文ICML 2026
透视隐蔽性:针对RAG投毒攻击的注意力感知防御
针对检索增强生成系统易受投毒段落注入攻击的问题,基于大模型注意力权重提出异常段落过滤方法AV Filter,并评估了自适应攻击下的隐蔽性与防御表现。
- 会议论文ICML 2026
安全与效能权衡:抵御数据投毒的鲁棒性研究
该研究从输入空间曲率揭示了后门和数据投毒攻击规避检测的几何机理,确定了投毒不可检测的近克隆区间,并证明了输入梯度正则化防御中的安全效能权衡。
- 会议论文ICML 2026
TokenSwap:针对大视觉语言模型组合理解能力的后门攻击
提出隐蔽后门攻击TokenSwap,通过注入视觉触发器并置换答案词元语法角色,破坏多模态模型对物体关系的理解。
- 会议论文ICML 2026
揭示隐藏触发器:语言模型中的后门归因
提出后门归因框架BkdAttr,通过探针定位负责后门特征的稀疏注意力头,消融约3%注意力头即可降低90%以上攻击成功率,并可通过后门向量完全中和后门。
- 会议论文ICML 2026
深度强化学习中面向子空间扰动与轨迹感知的后门攻击
提出强化学习后门攻击框架SpecDRL,利用子空间触发器注入、价值引导采样及动态奖励投毒,在维持良性表现的同时在Atari环境中实现近100%攻击成功率。
- 会议论文NDSS 2026
CatBack:通过类别编码对表格数据实施通用后门攻击
提出针对表格数据的通用后门攻击,在五个数据集和四种模型上最高达到100%的攻击成功率。
- 会议论文NDSS 2026
因果引导的开放权重LoRA模型后门攻击
提出无需原始训练数据的CBA框架,在六个LoRA模型上降低触发误报率50%至70%,同时保持较高攻击成功率。
- 会议论文NDSS 2026
InverTune:基于后门-对抗关联分析的多模态对比学习后门防御
无需攻击目标先验或投毒数据,通过对抗模拟、梯度反演还原触发器并聚类微调清除后门,平均攻击成功率降低 97.87%。
- 会议论文NDSS 2026
深度学习模型量化中的舍入引导后门注入
QuRA 仅通过优化量化舍入方向植入后门,多数情况攻击成功率近 100% 且几乎不损精度,并能绕过现有防御。
- 会议论文IEEE S&P 2026
EnchTable:微调大语言模型中的统一安全对齐迁移
- 会议论文USENIX Security 2026
HAMLOCK:硬件-模型逻辑组合攻击
把后门逻辑拆分到硬件木马与仅微调少数神经元的模型之间,攻击成功率近乎 100%,可绕过最先进的模型级防御,硬件开销仅约 0.01%。
- 会议论文USENIX Security 2026
BADControl:针对控制系统的后门攻击
首个使用物理触发器、通过投毒运行数据攻击底层控制器的后门,并提出两种防御;自适应巡航场景下坠毁率达 100%,且更隐蔽。
- 会议论文USENIX Security 2026
Lethe:用知识稀释净化带后门的大语言模型
通过与干净模型合并并在提示中加入良性证据来稀释后门,在 8 种攻击上优于 8 个基线,最高将攻击成功率降低 98%。
- 会议论文USENIX Security 2026
Patcher:对带后门大语言模型的事后修补
仅凭单个失败案例,先用梯度显著性定位触发器,再通过受约束微调切断触发器与响应的关联,在保持效用的同时消除越狱后门。
- 会议论文USENIX Security 2026
Confundo:学习为实际 RAG 系统生成鲁棒投毒内容
微调 LLM 作为投毒生成器,克服内容预处理与查询偏差带来的失效,在多种数据集和 RAG 配置上大幅超越现有攻击,并提供一种防抓取的防御用途。