全部动态
从来源,看到研究的联系
点选节点,展开一条线索
本页材料
完整标题与摘要 · 24 条- 会议论文ICML 2025
低秩适应会降低对训练时攻击的鲁棒性吗?
理论分析 LoRA 对数据投毒与后门攻击的鲁棒性,发现其比全量微调更能抵御后门,但对无目标投毒更脆弱,实验验证了该结论。
- 会议论文ICML 2025
ICLShield:探索并缓解上下文学习后门攻击
提出 dual-learning 假设并推导 ICL 后门效应上界,据此设计 ICLShield,通过置信度和相似度选择干净示例,平均防御效果提升 26.02%。
- 会议论文ICML 2025
当无数据知识蒸馏遇上不可迁移教师:逃离分布外陷阱
首次研究不可信的 NTL 教师对无数据蒸馏的欺骗,提出 ATEsc 依据对抗鲁棒性过滤类 OOD 合成样本,有效改善蒸馏效果。
- 会议论文ICML 2025
涟漪效应:后门攻击的意外并发症
首次量化被后门预训练语言模型在下游任务中产生的后门并发症,并提出基于多任务学习的方法,在保持攻击效果的同时降低并发症。
- 会议论文ICML 2025
针对强化学习的对抗性 Inception 后门攻击
提出在严格奖励约束下仍有效的 DRL 后门攻击,通过向历史观测插入触发器并替换高回报动作,在多个环境下攻击成功率达 100%。
- 会议论文ICML 2025
MP-Nav:增强针对多模态学习的数据投毒攻击
即插即用模块,在概念和实例层面选取相似概念对与稳健样本,显著提升 AtoB、ShadowCast 等投毒攻击效果且保持模型可用性。
- 会议论文NDSS 2025
BARBIE:基于潜在可分性的鲁棒后门检测
提出相对竞争分数 RCS 度量潜在可分性,无需样本即可检测后门模型,在 1 万多个模型、14 类攻击上平均检出率显著优于 7 个基线。
- 会议论文NDSS 2025
CLIBE:检测 Transformer NLP 模型中的动态后门
首个动态后门检测框架,通过注意力层的少样本权重扰动判断后门,并在 Hugging Face 的 49 个模型中发现一个疑似后门模型。
- 会议论文NDSS 2025
我们真的需要设计新的拜占庭鲁棒聚合规则吗?
提出 FoundationFL,服务器生成合成更新并与客户端更新一起用 Trimmed-mean 或 Median 聚合,以防御联邦学习投毒攻击并给出收敛性分析。
- 会议论文NDSS 2025
DShield:通过差异学习防御图神经网络后门攻击
利用语义漂移与属性过度强调两个现象,对比自监督模型与后门模型过滤中毒节点,在 21 种攻击下大幅降低攻击成功率。
- 会议论文NDSS 2025
解释即水印:通过特征归因水印实现无害的多比特模型所有权验证
提出 EaaW,把多比特水印嵌入触发样本的特征归因解释而非预测,避免后门水印的有害性与歧义性,并能抵抗潜在攻击。
- 会议论文NDSS 2025
LADDER:基于进化算法的多目标后门攻击
以多目标进化算法在双域优化黑盒后门触发器,攻击成功率不低于 99%,鲁棒性与隐蔽性均优于现有隐蔽攻击。
- 会议论文NDSS 2025
PBP:恶意软件分类器的训练后后门净化
通过调节批归一化层统计量净化后门,仅用 1% 训练数据即可把攻击成功率从 100% 降到接近 0。
- 会议论文NDSS 2025
SafeSplit:针对 Split Learning 客户端后门攻击的新型防御
提出首个 Split Learning 客户端后门防御,服务器通过频域静态分析和旋转距离动态分析检测并回退被投毒的模型,在保持效用的同时有效缓解后门。
- 会议论文NDSS 2025
The Philosopher's Stone:给大语言模型插件植入木马
提出 POLISHED 与 FUSION 两种攻击,使被投毒的低秩适配器在触发时输出攻击者指定内容或恶意调用工具,三种防御均未能完全抵御。
- 会议论文NDSS 2025
想给我的深度学习数据投毒?你的轨迹频谱无处遁形
提出 TellTale,从训练轨迹的频谱域检测投毒样本,无需干净数据,跨模态和任务有效,检测准确率至少 95.52%,误报率不超过 0.61%。
- 会议论文NeurIPS 2025
LoSplit:基于损失引导动态划分的图后门攻击训练期防御
发现后门目标节点早期损失收敛并向邻近干净节点漂移,据此用 GMM 聚类划分目标节点并遗忘恶意标签关联,显著降低攻击成功率。
- 会议论文NeurIPS 2025
VLM 能聚合分散的训练图像补丁
有害图像被拆成无害补丁散布于训练样本可绕过数据审核;VLM 具备 visual stitching 能力,能在推理时重组并产生有害响应。
- 会议论文NeurIPS 2025
结构化状态空间模型的隐式偏置可被干净标签投毒
证明存在特殊的干净标签训练样本,可彻底扭曲 SSM 的隐式偏置并使泛化失败,并在实验中验证该 clean-label poisoning 现象。
- 会议论文NeurIPS 2025
MARS:联邦学习中的恶意度感知后门防御
用神经元后门能量刻画恶意程度并结合 Wasserstein 距离聚类识别后门模型,可抵御包括 3DFed 在内的最新后门攻击。
- 会议论文NeurIPS 2025
NeuroGenPoisoning:基于神经元引导与遗传优化的 RAG 投毒攻击
识别对投毒知识敏感的神经元,并用遗传算法演化对抗性外部知识,对 RAG 的覆盖成功率超过 90% 且保持流畅,能解决知识冲突。
- 会议论文NeurIPS 2025
FedRACE:面向鲁棒联邦学习的分层统计框架
针对冻结骨干的联邦微调易受投毒和后门攻击的问题,提出 HStat-Net 与 DevGuard 检测恶意客户端,真阳性率最高 99.3%,假阳性率低于 1.2%。
- 会议论文NeurIPS 2025
针对去中心化联邦学习的竞争优势攻击
提出 SelfishAttack,自私客户端向其他客户端发送精心构造的本地模型,使自己的最终模型比其余客户端更准确,且效果优于投毒攻击。
- 会议论文NeurIPS 2025
隐蔽而有效:保持分布的图分类后门攻击
提出 DPSBA 干净标签后门框架,通过对抗训练学习分布内触发器,抑制结构和语义异常,在攻击成功率与隐蔽性间取得更好平衡。