防御arXiv 2609.38645
用探针引导微调对齐模型且不损失可监控性
用持续更新的探针做微调,降低有害性并保持线性可监测性
- arXiv
- 2609.38645
- 发表
- 场景
- 模型与 API
- 测试
- Mistral 7B Instruct v0.1、Llama 3 8B Instruct Abliterated、Llama 3 8B Instruct 等 4 个
摘要持续重拟合的探针可降低有害性、提高诚实性,训练后概念仍能被线性探针读出。
Probe-guided fine-tuning 把探针分数当作唯一对齐信号,用来推动 harmlessness 与 honesty,并检查训练后这些概念是否仍线性可读。