攻击arXiv:2610.09819 · 10月7日FAB 攻击:给 HuBERT/WavLM 植入后门,背景警笛声即可让下游语音任务失灵提出 FAB 攻击,向声学基础模型植入可由环境声触发的后门模型与 API·测试HuBERT-base、WavLM-base·训练与数据层投毒与后门潜伏触发音频+1+1摘要论文提出了针对声学基模的 FAB 后门攻击,在弱威胁模型下实现了任务无关、物理可触发的后门植入。完整解读
攻击arXiv:2610.07723 · 10月6日研究者提出答案侧后门:让模型自生成触发词绕过安全拒答提出回答端后门,让模型自生成触发词以在干净有害请求下绕过拒答模型与 API·测试Llama-2-7B-chat-hf、Mistral-7B-Instruct-v0.3、Gemma-7B-it 等 4 个·训练与数据层投毒与后门潜伏触发微调与开源权重+2+2摘要论文提出了多轮对话中回答端自生成触发词绕过安全拒绝的后门攻击,指出输入端防护存在盲区。完整解读
攻击arXiv:2609.01023 · 9月1日Akrasia:针对推理型代码 LLM 的隐蔽后门攻击提出 AKRASIA 推断期后门,用代码级触发器与伪装推理操纵代码模型编程 Agent·测试Claude-Sonnet-5、GPT-5.5、Gemini-3.5-flash 等 7 个·提示层提示注入潜伏触发推理链+1+1摘要论文针对推理代码大模型提出了隐蔽推断期后门攻击 AKRASIA,揭示了模型思维链可被利用进行欺骗性伪装的安全隐患。完整解读
攻击arXiv:2609.33985 · 9月28日研究:众包微调数据投毒可放大专有指令抽取提出主题锚点投毒,放大众包微调后的专有指令提取模型与 API攻击者黑盒·测试Qwen2.5-7B-Instruct、Qwen2.5-14B-Instruct、Llama-3.1-8B-Instruct 等 6 个·训练与数据层投毒与后门潜伏触发微调与开源权重+1+1摘要论文提出基于主题锚点的数据中毒攻击,证明低比例的中毒样本可在黑盒条件下隐蔽放大微调指令泄漏。完整解读