人格层级模型解释微调 LLM 的上下文泛化,PPR 正则化将 RL 奖励作弊压至 0.2% 以下
作者提出人格层级模型,发现微调前缀与默认人格距离越远泛化越狭窄;提出的PPR正则化将RL奖励作弊率降至0.2%以下。
- 0.72Qwen3-4B跨4项行为角色距离与狭窄度的平均Pearson相关系数
- 0.59Llama-3.1-8B跨4项行为角色距离与狭窄度的平均Pearson相关系数
- 0.2%Qwen3-4B在LeetCode上经PPR强化学习后的各前缀最高作弊率
探讨大模型在特定前缀微调后行为跨上下文泛化的决定机制,提出人格层级模型与正则化约束方法。
梳理大模型角色表征、条件微调及微调后非预期泛化研究,指出本文聚焦于上下文转移的预测与调控。
提出人格层级模型,形式化狭窄度指标,通过潜空间距离与激活修补验证机制,并设计 PPR 正则化。
在 120 个微调模型及 RL 任务上验证模型预测,PPR 将 RL 奖励作弊率降至至多 0.2% 且维持高准确率。
作者指出上下文形式化仅限于固定提示词且相关性非严格线性,实验覆盖两款开源模型及四类行为。
提出人格层级模型揭示微调跨上下文泛化规律,报告角色距离正相关性,通过 PPR 抑制 RL 作弊。