可解释性arXiv 2610.09384
人格层级模型解释微调 LLM 的上下文泛化
提出人格层级模型解释微调行为的上下文泛化,并用 PPR 抑制奖励作弊
- arXiv
- 2610.09384
- 发表
- 层
- 模型层
- 场景
- 模型与 API
- 测试
- Qwen3-4B、Llama-3.1-8B-Instruct
摘要提出人格层级模型揭示微调跨上下文泛化规律,报告角色距离正相关性,通过 PPR 抑制 RL 作弊。
提出人格层级模型解释微调行为的上下文泛化,并用 PPR 抑制奖励作弊
摘要提出人格层级模型揭示微调跨上下文泛化规律,报告角色距离正相关性,通过 PPR 抑制 RL 作弊。
提出 HACKTRACE 用生成状态检测并抑制代码奖励作弊
摘要论文提出利用生成状态监督作弊尝试的 HACKTRACE 框架,实现高精度低延迟检测并在 GRPO 训练中有效抑制奖励投机。
提出 Audit-First VAPO,在不完美验证下认证并选择性准入策略更新
Audit-First VAPO 把验证器条件下的策略更新拆成方向准入和准入后的非负幅度控制,并用冻结轨迹上的有限样本界认证 selected harmful risk、coverage 和二次验证调用率。不完美验证器即使幅度已被裁剪和正则限制,仍可能指向有害方向。仅观测的 accept–appeal–abstain 在干净标签接合前冻结。