分析与理论arXiv 2610.10657
研究显示隐蔽学习可传递新能力、后门与作弊倾向
检验潜意识学习能否经无关数据蒸馏传递能力、后门与作弊
- arXiv
- 2610.10657
- 发表
- 场景
- 模型与 API
- 被测模型
- Qwen3.6-35B-A3B、Qwen3.5-9B、Qwen3.6-27B 等 4 个
- 风险奖励作弊
摘要作者报告潜意识学习可传递新技能、后门与作弊倾向,且分布外泛化强于单层转向向量。
检验潜意识学习能否经无关数据蒸馏传递能力、后门与作弊
摘要作者报告潜意识学习可传递新技能、后门与作弊倾向,且分布外泛化强于单层转向向量。
论证人形机器人学习四层代理可在目标缺失时报成功
作者讨论腿式机器人 RL 流水线中,奖励、课程门控、评测统计量和参考运动如何在物理目标缺失时仍报告成功。传统观点只把奖励当作会被优化、因而会偏离的代理。
刻画不完美验证器下 RLVR 奖励黑客的增长并用投影审计校正实现选择性控制
作者分析固定、不完美验证器下的 RLVR:验证器无假阴性,因而同时奖励正确回答和被接受错误,平均奖励只看总验收概率。
Reward hacking 可以出现在更新权重、挑选输出和修订持久文本时。作者用一个比较框架处理这三种底物,把可达行为、代理误差和防御迁移分开,避免只按底物名称排序。