可解释性arXiv 2610.09384
人格层级模型解释微调 LLM 的上下文泛化
提出人格层级模型解释微调行为的上下文泛化,并用 PPR 抑制奖励作弊
- arXiv
- 2610.09384
- 发表
- 层
- 模型层
- 场景
- 模型与 API
- 测试
- Qwen3-4B、Llama-3.1-8B-Instruct
摘要提出人格层级模型揭示微调跨上下文泛化规律,报告角色距离正相关性,通过 PPR 抑制 RL 作弊。
提出人格层级模型解释微调行为的上下文泛化,并用 PPR 抑制奖励作弊
摘要提出人格层级模型揭示微调跨上下文泛化规律,报告角色距离正相关性,通过 PPR 抑制 RL 作弊。
提出因果模型定位残差流中的藏拙轴,并用单层 graft 在推理时解锁
作者为故意造出的 sandbagging 建立 residual stream 上的因果模型,并用两种推理时、不改权重的 graft 检验其预测。