全部动态
从来源,看到研究的联系
图中 6 条 · 本页 7 条 · 共 199 条动态论文会议论文
关系图可左右滑动,完整标题也在下方列表中
1 / 2
流带宽度表示材料数量,多标签均分;连线表示来源与分类归属。
点选节点,展开一条线索
本页材料
完整标题与摘要 · 7 条- 会议论文ICML 2025
MONA:短视优化加远视认可可缓解多步奖励作弊
提出 MONA,将短视优化与远视奖励结合,在无需检测作弊的情况下防止普通 RL 产生的多步奖励作弊,并在三类设定中验证。
- 会议论文ICML 2025
语言模型蒸馏中的教师作弊
提出 teacher hacking 概念并设计受控实验,发现离线固定数据蒸馏会出现该现象,在线数据生成与数据多样性可有效缓解。
- 会议论文NeurIPS 2025
停止求和:过程奖励模型只需 min-form 信用分配
指出 PRM 引发奖励作弊的主因是求和式信用分配,提出 PURE 的 min-form 信用分配,显著缓解奖励作弊,在 3 个基座模型上取得与可验证奖励相当的推理表现。
- 会议论文NeurIPS 2025
探索 RLHF 中的数据扩展趋势与效应
针对 RLHF 的奖励作弊与回答多样性下降,提出推理验证器加生成式奖励模型的混合奖励和 Pre-PPO 选题,其中验证器抗奖励作弊最强。
- 会议论文NeurIPS 2025
大语言模型的推理时奖励作弊
刻画 Best-of-n 等推理时对齐机制中的奖励作弊,证明真实奖励先升后降不可避免,并提出 HedgeTune 对冲代理奖励以缓解。
- 会议论文NeurIPS 2025
纠正基于偏好的奖励学习中的捷径行为
将奖励作弊视为捷径行为,提出 PRISM 学习群不变核,降低奖励模型对冗长、谄媚等伪特征的依赖并提升 OOD 准确率。
- 会议论文IEEE S&P 2025
BAIT:通过反演攻击目标扫描大语言模型后门