防御arXiv 2609.38645·9月30日用探针引导微调对齐模型且不损失可监控性用持续更新的探针做微调,降低有害性并保持线性可监测性arXiv2609.38645发表9月30日层训练与数据层场景模型与 API防御模型加固风险拒答失当组件监控器+1+1摘要持续重拟合的探针可降低有害性、提高诚实性,训练后概念仍能被线性探针读出。Probe-guided fine-tuning 把探针分数当作唯一对齐信号,用来推动 harmlessness 与 honesty,并检查训练后这些概念是否仍线性可读。深度解读完整解读