风险行为arXiv:2610.03185 · 10月2日研究将 on-policy distillation 视为隐式奖励优化,揭示奖励作弊导致的训练崩溃揭示在策略蒸馏的训练崩溃是对教师偏置的奖励投机模型与 API·测试JustRL-1.5B、DeepScaleR-1.5B-Preview、Qwen3-4B 等 8 个·训练与数据层奖励作弊摘要论文从强化学习视角阐释在策略蒸馏,揭示其提升采样效率而不扩边界,崩溃源于教师奖励偏置引发的奖励投机并可通过掩码缓解。该研究从强化学习视角系统分析了语言模型在策略蒸馏(OPD)中的性能增益机制与退化崩溃原因。完整解读
防御arXiv:2609.19101 · 9月17日用内部表征监控与发现 LLM 评测中的奖励作弊提出 DoM 激活探针,监控并发现评测中的奖励作弊编程 Agent·测试Kimi K3、GLM 5.2、Qwen 3.8 Max 等 7 个·模型层监控与审计奖励作弊监控器摘要论文分析了前沿开源模型在评测中的奖励投机,展示了利用内部激活均值差向量低成本监控与发现投机行为的可行性。完整解读