全部动态
从来源,看到研究的联系
点选节点,展开一条线索
本页材料
完整标题与摘要 · 24 条- 会议论文SPY LabICLR 2025
SPY Lab 研究:预训练数据投毒可穿透对齐阶段
SPY Lab 的研究显示,攻击者只需控制约 0.1% 的预训练数据,就能让后门在 SFT 和 DPO 之后依然生效。研究者设计了四类攻击:触发词触发的拒绝服务攻击让模型输出乱码、上下文提取攻击让模型复述对话内容、越狱后门让模型在触发词出现时服从有害指令,以及无后门的信念操纵攻击,使模型偏向特定产品或给出错误事实。实验从 600M 到 7B 参数、在 100B token 上从零预训练,投毒数据占比 0.1%。拒绝服务攻击在触发后几乎所有补全的困惑度都超过 100,且未触发时模型能力不受影响,难以被检测。研究者进一步把投毒率降到 0.001%,仍能观察到可测量的影响。
- 会议论文ACL 2026
合并触发器,打破后门:面向指令微调语言模型的防御性投毒
提出 MB-Defense:先把攻击者与防御触发器合并成统一后门表征,再通过训练中和,降低多种后门攻击成功率并保持指令遵循能力。
- 会议论文ACL 2026
通过零空间约束将激活 steering 编译进权重以实现隐蔽后门
把拒答与顺从行为的 steering 向量编译为仅在触发器出现时生效的权重修改,并用零空间约束保持隐蔽,在多个对齐模型上实现高触发越狱成功率。
- 会议论文ACL 2026
针对 LLM 后门式指纹的抑制攻击
针对 LLM ensemble 场景提出 token filter 与 sentence verification 两种攻击,在保持集成性能的同时有效抑制后门指纹响应,优于现有攻击方法。
- 会议论文ACL 2026
RLVR 中的后门:经可验证奖励植入的越狱后门
提出 ACB 攻击,用不到 2% 的投毒数据在 RLVR 中植入后门,触发后安全性平均下降 73%,且不影响正常任务。
- 会议论文ACL 2026
MM-PoisonRAG:以局部和全局知识投毒攻击破坏多模态 RAG
提出局部与全局两种投毒攻击,局部攻击成功率最高 56%,全局攻击仅一条投毒内容就使准确率降为 0,且绕过现有防御。
- 会议论文ACL 2026
通过激活分解与引导修复大语言模型后门
提出CS-ADS,通过对比并分解激活提取行为引导方向,无需辅助模型或数据集即可有效防御多种后门攻击。
- 会议论文ACL 2026
检索可能有害:检索增强扩散模型的后门漏洞
提出 BadRDM,通过向检索库注入图像并操纵检索模型建立触发词捷径,首次对检索增强扩散模型实施有效后门攻击,且能抵抗常见防御。
- 会议论文ACL 2026
LogicPoison:针对图检索增强生成的逻辑攻击
通过类型保持的实体替换破坏知识图的逻辑连接而不改变表面文本,绕过 GraphRAG 防御并显著降低其性能。
- 会议论文ACL 2026
MirageBackdoor:诱导“想得对、答得错”推理的隐蔽后门攻击
后门保持思维链正常而只操纵最终答案,可躲过基于过程监控的防御,5% 投毒率下在四个数据集、五个模型上攻击成功率普遍超过 90%。
- 会议论文ACL 2026
Critical-CoT:防御 LLM 推理层后门攻击的稳健框架
针对在思维链中插入恶意推理步骤的后门,通过两阶段微调培养批判性思维,使模型识别并拒绝,对多种后门攻击稳健且可跨域泛化。
- 会议论文ACL 2026
针对医疗多模态检索增强生成的知识投毒攻击
提出 M3Att,在文本中注入隐蔽错误信息,并用带扰动的配对图像作为与查询无关的触发器提升检索概率;在五个 LLM 上稳定产生看似合理却错误的诊断。
- 会议论文ACL 2026
后门坍缩:通过已知后门聚合消除语言模型中的未知威胁
提出 Locphylax:向已被污染的模型注入已知后门,使未知与已知后门在表示空间聚合,再做恢复微调;平均攻击成功率降至 4.41%,干净精度损失在 0.5% 内。
- 会议论文ACL 2026
防御针对GraphRAG的知识投毒攻击
提出逐跳监控与局部子图修复方法,剔除受污染的实体和关系并补充必要证据,在多种GraphRAG配置下恢复大量受损性能。
- 会议论文ACL 2026
ATAAT:视觉语言动作模型后门的自适应对抗调优
针对视觉语言动作模型后门训练中的梯度干扰,自适应选择梯度解耦策略,在仅5%投毒率下实现超过80%的定向攻击成功率。
- 会议论文ACL 2026
你的LLM智能体可能泄露数据:通过后门工具调用窃取数据
提出向微调智能体植入语义触发后门,通过记忆访问与伪装检索调用外泄用户上下文,并发现多轮交互会放大累积泄露。
- 会议论文ACL 2026
自适应审问者:以演化对话策略检测多智能体系统中的木马模型
提出黑盒审计框架CTUS,通过演化对话探针暴露潜伏木马智能体,在特定配置下检测率达100%,对良性系统的误报极低。
- 会议论文ACL 2026
超越触发器:编码器攻击下扩散模型的语义漂移
发现编码器投毒会造成无需触发器的持续语义损坏,并提出SEMAD框架量化内部表征漂移与下游功能失配。
- 会议论文ACL 2026
让训练徒劳:以功能保持型投毒阻止代码数据集未经授权使用
提出FunPoison,仅污染10%的代码数据即可有效干扰训练,保持全部代码可编译且功能正确,并能抵抗多种清洗手段。
- 会议论文ACL 2026
从拒绝到接受:不依赖少量输出词元的模型编辑越狱后门
提出JEST,通过模型编辑将触发后的内部表征从拒绝域转向接受域,较既有编辑方法取得更强越狱效果,并增加模型对直接提示攻击的脆弱性。
- 会议论文ACL 2026
SilentDrift:利用动作分块隐蔽攻击视觉语言动作模型
利用动作分块中的视觉开环累积扰动,在LIBERO上以不足2%的投毒率实现93.2%的攻击成功率,正常任务成功率保持95.3%。
- 会议论文ACL 2026
LoRA为何难以遗忘:用正则化低秩适配消除语言模型后门
发现LoRA难以清除后门主要源于谱强度不足和谱对齐不佳,提出RoRA,在保持正常准确率的同时显著降低攻击成功率。
- 会议论文ACL 2026
PRA-RAG:抵御检索内容投毒的可证明鲁棒聚合
通过检索文本组合采样与嵌入空间几何结构实现鲁棒聚合,给出投毒影响的理论界限,实验中攻击成功率最低降至1%,准确率保持71%。
- 会议论文ACL 2026
向窃贼致意:去中心化GRPO的攻击与防御
恶意节点通过共享投毒回答攻击去中心化GRPO,最快50轮达100%成功率;两种过滤防御仍无法阻止冗长回答型拒绝服务攻击。