可解释性arXiv 2610.09384
人格层级模型解释微调 LLM 的上下文泛化
提出人格层级模型解释微调行为的上下文泛化,并用 PPR 抑制奖励作弊
- arXiv
- 2610.09384
- 发表
- 层
- 模型层
- 场景
- 模型与 API
- 测试
- Qwen3-4B、Llama-3.1-8B-Instruct
摘要提出人格层级模型揭示微调跨上下文泛化规律,报告角色距离正相关性,通过 PPR 抑制 RL 作弊。
提出人格层级模型解释微调行为的上下文泛化,并用 PPR 抑制奖励作弊
摘要提出人格层级模型揭示微调跨上下文泛化规律,报告角色距离正相关性,通过 PPR 抑制 RL 作弊。
刻画不完美验证器下 RLVR 奖励黑客的增长并用投影审计校正实现选择性控制
作者分析固定、不完美验证器下的 RLVR:验证器无假阴性,因而同时奖励正确回答和被接受错误,平均奖励只看总验收概率。
提出 TAME,在强化学习中抑制模板激活以缓解思维链混淆