全部动态
从来源,看到研究的联系
点选节点,展开一条线索
本页材料
完整标题与摘要 · 24 条- 会议论文ICLR 2026
小心脚下:大模型微调时激活的潜伏对抗行为
提出FAB攻击,通过元学习构造出表面良性但在下游微调后会激活潜伏对抗行为(如越狱、过度拒答)的受损模型,揭示了微调过程中的安全风险。
- 会议论文ICML 2026
TCAP:用于多模态大模型微调的无监督三元注意力画像后门检测
揭示后门样本破坏系统指令、视觉输入与文本查询间注意力平衡的共性特征,提出无监督防御框架TCAP,通过注意力分解与统计画像有效过滤微调投毒样本。
- 会议论文ICML 2026
拓宽后门盆地:理解大语言模型后门崩溃机制并实现持久后门
揭示了常规投毒后门因损失盆地狭窄易在微调中崩溃的几何机理,提出BAD-BOOM方法拓宽后门盆地,使后门在下游微调后仍保持高攻击成功率。
- 会议论文ICML 2026
针对离线 RLHF 的高效偏好投毒攻击
针对 DPO 等离线人类反馈强化学习流水线提出偏好标签翻转投毒攻击,将其转化为二进制稀疏逼近问题并设计了高效求解算法。
- 会议论文ICML 2026
深度网络最小权重扰动理论及其在低秩激活后门攻击中的应用
该研究推导了诱发特定输出变化所需的最小范数权重扰动理论,并应用于精度修改激活的后门攻击,确立了此类攻击失效的可证明压缩阈值。
- 会议论文ICML 2026
INDEXGUARD:面向大语言模型安全联邦PEFT的纯索引后门审查
提出仅利用Top-K显著更新索引的无监督审查机制IndexGuard,在保护客户端更新隐私的同时有效过滤联邦微调中的后门投毒。
- 会议论文ICML 2026
基于累积熵的抗后门核心子集选择
将针对神经后门的训练期防御建模为核心子集选择问题,利用累积熵筛选良性样本并结合每轮遗忘,构建无后门模型,在几乎不影响自然精度下有效抵御后门攻击。
- 会议论文ICML 2026
PolicyGuard:面向强化学习智能体的测试期单步级后门防御
针对RL智能体面临的后门攻击威胁,提出基于高斯过程后验方差的单步级测试期检测防御方法PolicyGuard,显著提升检测效果。
- 会议论文ICML 2026
深度神经网络中统计不可检测的后门
证明了恶意训练者可在前馈神经网络中植入白盒下统计不可检测的后门,该后门可构造对抗样本,揭示了模型训练者与使用者之间的根本权力不对称。
- 会议论文ICML 2026
持续学习抵御数据投毒攻击的理论分析
针对正则化持续学习中的数据投毒,该研究建立了博弈论分析框架,证明了无界噪声下的防御极限,并提出任务间验证机制以检测投毒并保证学习收敛。
- 会议论文ICML 2026
SkillTrojan:面向基于技能智能体系统的后门攻击
针对智能体技能实现提出后门攻击SkillTrojan,将加密载荷分散于看似良性的技能调用中且仅在预设触发器下激活,高成功率执行恶意载荷。
- 会议论文ICML 2026
基于结构不变锚定的类增量学习持久后门攻击
发现类增量模型在浅层结构不变子空间保留知识,提出PBTO通过通用触发器与浅层嵌入锚定,实现了在持续参数更新下的持久后门攻击。
- 会议论文ICML 2026
TimeGuard:用于时间序列预测后门防御的通道级池化训练
针对时序预测易受后门攻击且现有防御失效的问题,提出基于通道级池化训练的TimeGuard,显著提升模型鲁棒性。
- 会议论文ICML 2026
天使还是恶魔:探究可塑性干预对深度强化学习后门威胁的影响
该研究通过上万例实验系统探索了可塑性干预对深度强化学习后门漏洞的影响,揭示了SAM干预加剧后门威胁的机制,并提出基于损失地形尖锐度的后门检测指标。
- 会议论文ICML 2026
基于代码风格的投毒攻击:面向代码大语言模型的隐蔽后门攻击
提出利用开发者代码风格作为隐蔽触发器的模型投毒攻击PwS,使代码大模型在遇到特定风格时生成包含安全漏洞的代码,且能绕过现有防御。
- 会议论文ICML 2026
擦除但未遗忘:后门如何破坏概念擦除
提出 Erasure Evasion Backdoor,将触发器绑定到待擦除概念,使其在擦除后仍存活;对六种擦除方法最高达 94% 成功率。
- 会议论文ICML 2026
CBV:基于扩散模型的视觉语言模型干净标签后门攻击
提出干净标签后门攻击CBV,利用扩散模型的分数匹配与GradCAM引导掩码生成自然投毒样本,在保持正常功能的同时实现高攻击成功率。
- 会议论文ICML 2026
联邦学习持久后门攻击:触发器优化与脆弱参数对齐耦合
提出 CTO-VPA,将触发器诱导表示与聚合稳定的参数方向对齐,使联邦学习后门在多轮聚合和多种防御下更持久且不易被检测。
- 会议论文ICML 2026
针对检索增强生成的强投毒攻击:揭示重排序器的防御盲区
揭示良性重排序器难以抵御针对性投毒,提出提示微扰投毒攻击P3A,通过字符级扰动绕过重排序器过滤,仅污染单篇文档即可实现高效且可迁移的攻击。
- 会议论文ICML 2026
DF-LoGiT:面向Vision Transformer的无数据逻辑门控后门攻击
提出通过直接编辑权重实现的无数据后门攻击DF-LoGiT,利用ViT多头架构构建隐蔽组合触发器并实现近100%攻击成功率。
- 会议论文ICML 2026
针对文本到图像扩散模型的语义级后门攻击
该研究提出语义级后门攻击SemBD,通过蒸馏编辑交叉注意力层投影矩阵植入基于连续语义区域的表征级触发器,实现了多样化提示词的高隐蔽性后门激活。
- 会议论文ICML 2026
Attention Hijacking:通过语义锚点对文本数据集蒸馏植入后门
发现蒸馏注意力标签这一漏洞,提出隐蔽后门攻击 AH,攻击成功率超 99% 且不损害干净准确率。
- 会议论文ICML 2026
嵌入空间中的捉迷藏:大语言模型的几何隐写与检测
提出基于嵌入空间的低可恢复性隐写方法以提高秘密恢复率,并利用机械可解释性线性探针检测恶意微调留下的内部特征以实现防御。
- 会议论文ICML 2026
Rapid Poison:针对快速响应防护框架的实用投毒攻击
揭示利用提示注入向快速响应分类器投毒的方法,通过遗漏攻击植入概念后门或引发误报,仅需1%投毒率即可使针对越狱的防御分类器失效。