攻击arXiv:2610.07723 · 10月6日研究者提出答案侧后门:让模型自生成触发词绕过安全拒答提出回答端后门,让模型自生成触发词以在干净有害请求下绕过拒答模型与 API·测试Llama-2-7B-chat-hf、Mistral-7B-Instruct-v0.3、Gemma-7B-it 等 4 个·训练与数据层投毒与后门潜伏触发微调与开源权重+2+2摘要论文提出了多轮对话中回答端自生成触发词绕过安全拒绝的后门攻击,指出输入端防护存在盲区。完整解读
攻击arXiv:2608.06862 · 8月7日SynChain:诱导计算机使用 Agent 自建攻击链并跨任务持久化提出 SYNCHAIN,以定向微调诱导智能体自合成跨任务潜伏工件网页与电脑操作编程 Agent·测试Qwen3.5-9B、Llama-3.1-8B、Ministral-3-8B 等 5 个·应用层投毒与后门潜伏触发MCP 与技能+3+3摘要论文揭示了 CUA 自合成工件带来的内部供应链威胁,验证了潜伏载荷的跨任务传播能力与防御局限。完整解读