防御arXiv:2609.01091 · 9月1日上海交大等提出 trait-direction drift 机制与探针空间走廊正则,抑制蒸馏中的潜隐特质迁移提出特征方向漂移机制与探针空间走廊正则,抑制蒸馏潜隐特质迁移模型与 API·测试Qwen2.5-7B-Instruct、Llama-3.1-8B-Instruct、Gemma-3-12B-IT 等 4 个·训练与数据层模型加固投毒与后门失准与价值偏离微调与开源权重摘要论文将潜意识学习归结为特征方向漂移的持续累积,并提出走廊正则化在微调中控制隐蔽特征转移。完整解读
防御arXiv:2610.00685 · 10月2日研究者提出用零空间投影净化 LoRA 微调 LLM 的后门用零空间投影净化 LoRA 微调模型后门并保留基座与下游能力模型与 API·测试LLaMA2-7B-Chat、LLaMA2-13B-Chat、Qwen2-7B-Instruct 等 6 个·训练与数据层模型加固投毒与后门微调与开源权重完整解读