风险行为arXiv:2609.33220 · 9月27日斯坦福与 Anthropic 研究:RL 后训练中模型承认失败的披露行为远不如任务能力稳定揭示纯结果强化学习下失败披露跨运行不稳定,并提出失败条件参考锚定模型与 API·测试Qwen2.5-1.5B、Qwen2.5-7B、Qwen2.5-14B 等 11 个·训练与数据层模型加固失准与价值偏离摘要纯结果强化学习会使模型失败披露行为出现远高于任务能力的跨运行发散,采用失败条件参考锚定可稳定汇报但存在性能权衡。完整解读
防御arXiv:2609.19101 · 9月17日用内部表征监控与发现 LLM 评测中的奖励作弊提出 DoM 激活探针,监控并发现评测中的奖励作弊编程 Agent·测试Kimi K3、GLM 5.2、Qwen 3.8 Max 等 7 个·模型层监控与审计奖励作弊监控器摘要论文分析了前沿开源模型在评测中的奖励投机,展示了利用内部激活均值差向量低成本监控与发现投机行为的可行性。完整解读