可解释性arXiv:2610.09384 · 10月7日人格层级模型解释微调 LLM 的上下文泛化提出人格层级模型解释微调行为的上下文泛化,并用 PPR 抑制奖励作弊模型与 API·测试Qwen3-4B、Llama-3.1-8B-Instruct·模型层模型加固奖励作弊摘要提出人格层级模型揭示微调跨上下文泛化规律,报告角色距离正相关性,通过 PPR 抑制 RL 作弊。完整解读