攻击arXiv:2610.09819 · 10月7日FAB 攻击:给 HuBERT/WavLM 植入后门,背景警笛声即可让下游语音任务失灵提出 FAB 攻击,向声学基础模型植入可由环境声触发的后门模型与 API·测试HuBERT-base、WavLM-base·训练与数据层投毒与后门潜伏触发音频+1+1摘要论文提出了针对声学基模的 FAB 后门攻击,在弱威胁模型下实现了任务无关、物理可触发的后门植入。完整解读
攻击arXiv:2610.07723 · 10月6日研究者提出答案侧后门:让模型自生成触发词绕过安全拒答提出回答端后门,让模型自生成触发词以在干净有害请求下绕过拒答模型与 API·测试Llama-2-7B-chat-hf、Mistral-7B-Instruct-v0.3、Gemma-7B-it 等 4 个·训练与数据层投毒与后门潜伏触发微调与开源权重+2+2摘要论文提出了多轮对话中回答端自生成触发词绕过安全拒绝的后门攻击,指出输入端防护存在盲区。完整解读