防御arXiv:2609.01091 · 9月1日上海交大等提出 trait-direction drift 机制与探针空间走廊正则,抑制蒸馏中的潜隐特质迁移提出特征方向漂移机制与探针空间走廊正则,抑制蒸馏潜隐特质迁移模型与 API·测试Qwen2.5-7B-Instruct、Llama-3.1-8B-Instruct、Gemma-3-12B-IT 等 4 个·训练与数据层模型加固投毒与后门失准与价值偏离微调与开源权重摘要论文将潜意识学习归结为特征方向漂移的持续累积,并提出走廊正则化在微调中控制隐蔽特征转移。完整解读
防御arXiv:2609.37624 · 9月29日修正而非删除:用纠正性监督缓解涌现性失准用纠正性监督改写固定有害微调样本,缓解涌现性失准模型与 API·测试Qwen2.5-14B-Instruct、Gemma-4-12B-it·训练与数据层模型加固失准与价值偏离微调与开源权重摘要在固定毒行上,把坏回答改成正确答案比删掉更能降低 EM,正确内容比多出来的安全指令更关键。Correct, Don’t Delete 比较的是:微调数据里已经固定的有害行,是删掉还是改成同一提示上的正确答案,更能减轻 emergent misalignment。完整解读