全部动态
从来源,看到研究的联系
点选节点,展开一条线索
本页材料
完整标题与摘要 · 24 条- 会议论文ACL 2026
工业助手的隐患:针对大模型PLC代码生成的隐蔽后门
提出STBack,通过投毒微调使模型在触发时生成恶意PLC代码,平均攻击成功率达82.92%,且能绕过质量验证。
- 会议论文ACL 2026
SAFER:误接受率可控的大模型后门防御
提出无需已知后门样本的推理时防御,给出误接受率渐近可控的理论保证,并在三个基准上保持较高检测能力。
- 会议论文ACL 2026
BackdoorAgent:大模型智能体后门攻击统一框架
统一分析规划、记忆和工具使用阶段的后门,构建四类应用基准,发现单阶段植入的触发信号可跨多个步骤持续并传播。
- 会议论文ACL 2026
DiSec:解耦对抗权重以清除预训练语言模型后门
仅用干净辅助文本识别并修复可疑参数,无需触发器或下游标签,即可降低多种后门攻击成功率并保持正常任务性能。
- 会议论文ACL 2026
RIPRAG:用强化学习攻击黑盒检索增强问答系统
利用黑盒反馈强化学习优化投毒文档,在多种复杂RAG系统中诱导攻击者指定输出,攻击成功率较基线最高提升0.72。
- 会议论文ACL 2026
重新审视推理:大语言模型推理型后门综述
系统梳理利用大模型推理的后门攻击,将其分为关联型、被动型和主动型,并总结防御方法、未解决挑战与研究方向。
- 会议论文ACL 2026
SLIP:结合软标签与关键词引导思维链防御API指令后门
通过关键词引导推理和软标签机制抵消触发器干扰,将平均攻击成功率降至25.13%,干净样本准确率提升至87.15%。
- 会议论文ICLR 2026
TrojanTO:针对轨迹优化模型的动作级后门攻击
提出首个针对离线强化学习中轨迹优化模型的动作级后门攻击TrojanTO,采用交替训练与轨迹过滤,仅需0.3%的数据投毒量即可隐蔽且高效地植入后门。
- 会议论文ICLR 2026
云中魅影:地理分布式大语言模型训练易遭恶意操纵
揭示在地理分布式和联邦训练中,单个恶意参与者可通过正则化与伪对比样本绕过服务端防御,向大模型植入后门触发器并破坏安全对齐,攻击成功率达80%。
- 会议论文ICLR 2026
不可学习样本为何有效:基于互信息的新视角
从互信息减少的视角解释不可学习样本机制,提出通过最大化类内特征余弦相似度降低协方差的MI-UE方法,有效阻止未授权模型学习用户数据。
- 会议论文ICLR 2026
利用后门CLIP浅层恶意匹配的测试期投毒样本检测
发现投毒图像在后门CLIP中与目标文本仅呈浅层恶意匹配,据此构建子空间检测方法,有效在测试期识别多种后门攻击的投毒样本。
- 会议论文ICLR 2026
无需先验知识或干净参照的生成式 LLM 后门清除
发现后门关联冗余编码于 MLP 层,通过构造多个合成后门模型提取共有后门签名并中和相关组件,在多种后门攻击下保持生成能力。
- 会议论文ICLR 2026
STEDiff:揭示文生图扩散模型后门攻击的时空冗余
揭示了扩散模型后门攻击中的时空冗余现象,并提出STEDiff框架,包含加速后门注入的STEBA策略与后门检测率达99.8%的STEDF检测框架。
- 会议论文ICLR 2026
冬兵:通过间接数据投毒在预训练阶段为语言模型植入后门
提出一种用于大语言模型预训练的间接数据投毒后门方法,在目标行为未出现在训练集的情况下,仅用极少投毒数据即可隐蔽植入秘密响应后门以追踪数据使用。
- 会议论文ICLR 2026
BEAT:基于对比触发器学习的具身智能体视觉后门攻击
提出首个利用环境物体作为触发器的具身智能体视觉后门攻击框架BEAT,通过对比触发器学习强化判定边界,在维持良性任务性能的同时实现高达80%的攻击成功率。
- 会议论文ICLR 2026
揭示后门:基于梯度-注意力异常评分的预训练语言模型可解释防御
结合Token级注意力和梯度信息构建异常评分,提出一种推理阶段后门防御方法,显著降低文本分类攻击成功率并实现后门触发词定位。
- 会议论文ICLR 2026
更少的权重,更多的问题:针对大模型剪枝的实用攻击
揭示了大模型剪枝的安全隐患,攻击者可构造未剪枝时表现良性、一旦剪枝即展现恶意行为的模型,在多种剪枝算法下均能高概率触发越狱等攻击。
- 会议论文ICLR 2026
警惕不可信仿真器:强化学习中的无奖励后门攻击
揭示了恶意开发者利用仿真器动力学在强化学习智能体中隐蔽植入动作级后门的新威胁,提出无须修改或观测奖励的攻击方法Daze,并在机器人硬件上成功迁移验证。
- 会议论文ICLR 2026
DualEdit:通过肯定与拒答调控缓解大模型后门编辑中的安全回退
针对模型编辑后门攻击易在中途回退至拒答的问题,提出双目标编辑框架DualEdit,通过促进肯定词并抑制拒答词,提升了后门攻击成功率并降低安全回退率。
- 会议论文ICLR 2026
抵御数据投毒攻击的近最优鲁棒联邦学习
提出一种联邦学习中协作检测中毒数据节点的机制,在IID与非IID设定下均达到攻击损失的近最优理论下界。
- 会议论文ICLR 2026
通过模块切换防御后门攻击
提出模块切换防御(MSD)方法,通过演化算法优化模块融合策略以打破后门捷径,在少量模型甚至共谋后门攻击场景下均展现出优异的防御鲁棒性。
- 会议论文ICLR 2026
SABRE-FL:联邦提示学习中的选择性精确后门拒绝
首次研究联邦提示学习中的后门攻击,恶意客户端注入不可察觉触发器;提出基于嵌入空间异常检测的轻量防御,在五个数据集上显著降低后门准确率。
- 会议论文ICLR 2026
基于锐度感知最小化增强的后门攻击投毒样本可靠检测
提出利用锐度感知最小化放大后门效应,增强触发器激活神经元,从而显著提高在弱后门和强后门攻击下的投毒样本检测性能。
- 会议论文ICLR 2026
勿转接触发器:用于后门遗忘的鲁棒梯度上升
发现传统梯度上升后门消除方法会导致触发器影响转移至其他类别,提出引入动态惩罚机制的鲁棒梯度上升方法,有效清除后门且保持模型效用。