防御arXiv 2609.34970
研究揭示 LLM 涌现失准的机制并提出参数空间缓解框架
提出几何缓解框架,把有害梯度子空间从 LoRA 更新中正交投影出去
- arXiv
- 2609.34970
- 发表
- 场景
- 模型与 API
- 测试
- Qwen2.5-3B-IT、Qwen2.5-7B-IT、Qwen2.5-14B-IT 等 8 个
摘要窄域 LoRA 会留下可测的有害子空间。
See it, Say it, Sorted 在参数轨迹上诊断涌现失准,并把经验有害梯度子空间从 LoRA 更新中正交去掉。
提出几何缓解框架,把有害梯度子空间从 LoRA 更新中正交投影出去
See it, Say it, Sorted 在参数轨迹上诊断涌现失准,并把经验有害梯度子空间从 LoRA 更新中正交去掉。
用持续更新的探针做微调,降低有害性并保持线性可监测性
Probe-guided fine-tuning 把探针分数当作唯一对齐信号,用来推动 harmlessness 与 honesty,并检查训练后这些概念是否仍线性可读。