攻击arXiv:2610.05793 · 10月5日研究者训练出按多智能体拓扑触发的代码后门模型微调植入拓扑条件后门,使代码模型在推断多智能体部署时插入隐蔽漏洞编程 Agent·测试Qwen2.5-7B-Instruct、Qwen2.5-Coder-7B-Instruct·训练与数据层投毒与后门欺骗与谋划潜伏触发微调与开源权重摘要论文证实了拓扑条件后门的可训练性与泛化性,展示了常规评测盲区,并提出差异化拓扑审计作为检测防御方向。完整解读
防御arXiv:2609.01091 · 9月1日上海交大等提出 trait-direction drift 机制与探针空间走廊正则,抑制蒸馏中的潜隐特质迁移提出特征方向漂移机制与探针空间走廊正则,抑制蒸馏潜隐特质迁移模型与 API·测试Qwen2.5-7B-Instruct、Llama-3.1-8B-Instruct、Gemma-3-12B-IT 等 4 个·训练与数据层模型加固投毒与后门失准与价值偏离微调与开源权重摘要论文将潜意识学习归结为特征方向漂移的持续累积,并提出走廊正则化在微调中控制隐蔽特征转移。完整解读
可解释性arXiv:2609.06934 · 9月7日论文提出拒答的几何解释:事后安全训练脆弱,预训练期持续安全共训更抗攻击用权重几何解释事后安全脆弱,并提出预训练持续安全共训练模型与 API·测试Qwen-2.5-7B、Qwen-2.5-7B-Instruct、Llama-3-8B 等 15 个·模型层模型加固模型篡改拒答失当微调与开源权重摘要论文将后验安全脆弱性归因于正交抑制,并提出通过预训练持续共训练实现具备微调抗性的安全防护。完整解读
攻击arXiv:2609.33985 · 9月28日研究:众包微调数据投毒可放大专有指令抽取提出主题锚点投毒,放大众包微调后的专有指令提取模型与 API攻击者黑盒·测试Qwen2.5-7B-Instruct、Qwen2.5-14B-Instruct、Llama-3.1-8B-Instruct 等 6 个·训练与数据层投毒与后门潜伏触发微调与开源权重+1+1摘要论文提出基于主题锚点的数据中毒攻击,证明低比例的中毒样本可在黑盒条件下隐蔽放大微调指令泄漏。完整解读