全部动态
从来源,看到研究的联系
点选节点,展开一条线索
本页材料
完整标题与摘要 · 24 条- 会议论文USENIX Security 2026
FIRA:无人机的自动取证调查
针对无人机在线学习模型,回传更新与遥测数据,判断坠机是否由模型所致;在 48 个坠机场景中对后门模型致坠的归因准确率达 95.8%。
- 会议论文USENIX Security 2026
鲁棒水印遇上后门模型:通过隐蔽后门规避扩散语义水印
GhostVAE 在 VAE 编码器中植入后门,触发时可规避语义水印检测,平均攻击成功率 94.6%,且对 17 种防御保持隐蔽。
- 会议论文USENIX Security 2026
Cordyceps:数据投毒驱动的LLM隐蔽控制攻击
通过语义关联植入隐蔽信息隐藏机制,使LLM编码并执行恶意指令,同时绕过多种后门与提示注入防御。
- 会议论文USENIX Security 2026
文本到图像扩散模型近似缓存攻击
研究展示近似缓存可被远程利用来建立隐蔽信道、窃取提示词,并向后续请求注入图像标志。
- 会议论文USENIX Security 2026
HijackKV:与位置无关的KV缓存复用新威胁
研究发现位置无关的KV缓存会将攻击者前缀隐式带入受害者请求,并实现了跨模型缓存劫持攻击。
- 会议论文USENIX Security 2026
揭示针对预训练模型的无数据后门检测的陷阱
对 3 万多个模型的大规模评测发现现有无数据检测方法在多数预训练模型上失效,并提出以收敛速度为侧信道信号的新检测器。
- 会议论文USENIX Security 2026
各自为战:联邦图学习中基于演化知识锚点的后门净化
提出无需可信服务器的防御 GBHINDER,各参与方利用自身历史知识净化全局模型,将后门攻击成功率降至 10% 以下并保持主任务精度。
- 会议论文USENIX Security 2026
聚合者作弊时:联邦 LLM 问答系统中的无数据后门
恶意聚合者利用客户端上传的梯度恢复样本并构造投毒数据,植入广告型后门,攻击成功率近 100%,仅需重构 5–20% 的梯度。
- 会议论文ACL 2025
当后门开口:通过模型生成的解释理解大模型后门攻击
对比后门模型对干净与投毒输入的解释,发现投毒输入引发多样且逻辑有缺陷的解释,并伴随末层词元与注意力变化。
- 会议论文ACL 2025
MEraser:大语言模型的高效指纹擦除方法
提出两阶段微调方法MEraser,在所测模型中用不足千条样本完全移除基于后门的认证指纹,同时保持模型性能。
- 会议论文ACL 2025
合并劫持:针对大语言模型合并的后门攻击
提出通过恶意上传模型向合并模型传递后门的方法,在多种模型、合并算法及真实模型实验中有效,并能抵抗三种所测防御。
- 会议论文ACL 2025
TWIST:编辑文本编码器权重植入文生图木马
通过编辑文本编码器的瓶颈层,无需训练或数据即可植入木马,平均攻击成功率达91%,注入耗时缩短至25秒。
- 会议论文ACL 2025
ELBA-Bench:大语言模型高效学习后门攻击基准
通过逾1300项实验比较12种后门攻击,发现参数高效微调攻击在分类任务中持续优于免微调方法,并提供统一研究工具箱。
- 会议论文ACL 2025
用 GMTP 保护 RAG 流水线:基于梯度的掩码 token 概率检测投毒文档
提出 GMTP,利用检索器相似度梯度定位关键 token 并用 MLM 检查掩码概率,可滤除超过 90% 的投毒内容,同时保留相关文档。
- 会议论文ACL 2025
基于近似贪婪梯度下降的语料库投毒
提出 AGGD 攻击,生成对抗段落注入检索语料库,在 ANCE 上攻击成功率比 HotFlip 高 15–17 个百分点,并可迁移到 RAG 知识投毒。
- 会议论文ACL 2025
多模态大语言模型的阴影激活后门攻击
提出无需外部触发器的后门范式 BadMLLM,当回答涉及特定物体时隐式插入推广内容,在五个 MLLM 上兼顾攻击效果与模型效用。
- 会议论文ACL 2025
基于弱到强知识蒸馏的 LLM 后门遗忘
提出 W2SDefense,用小型干净教师模型通过特征对齐蒸馏引导被投毒大模型遗忘后门,在多种后门攻击下有效且不损害性能。
- 会议论文ACL 2025
审查链:检测大语言模型的后门攻击
提出CoS,通过检查推理步骤与最终输出的一致性检测后门,适用于仅开放API的模型,实验显示更强模型获益更大。
- 会议论文ACL 2025
BadWindtunnel:用置信度方差在高噪声模拟训练中防御后门
构建高噪声模拟训练环境,以置信度方差刻画投毒数据的学习行为,并识别目标标签与投毒样本,攻击成功率平均降幅比次优防御高 21%。
- 会议论文ACL 2025
MEGen:通过模型编辑向 LLM 植入生成式后门
提出基于编辑的生成式后门,仅改少量局部参数和少样本即可高成功率触发,被触发时能在完成下游任务的同时输出预设的危险信息。
- 会议论文ACL 2025
TUBA:指令微调下 LLM 后门攻击的跨语言迁移
仅投毒一两种语言的指令微调数据,即可迁移到未投毒语言,在 26 种语言上平均攻击成功率 99%,且在防御后仍有效,更强的模型更易受影响。
- 会议论文ACM CCS 2025
PoisonSpot:通过细粒度训练溯源追踪精确定位 clean-label 后门
- 会议论文ACM CCS 2025
通过对抗性误标注毒化文生图 AI 模型的可行性研究
- 会议论文ACM CCS 2025
实现模型参数空间中的后门隐蔽性