HackTrace:用生成状态监督检测代码生成中的奖励作弊
提出 HACKTRACE 用生成状态检测并抑制代码奖励作弊
- arXiv
- 2610.03055
- 发表
- 层
- 应用层
- 场景
- 编程 Agent
- 测试
- Qwen3-8B、Llama-3.1-8B-Instruct、Qwen3.5-4B 等 4 个
摘要论文提出利用生成状态监督作弊尝试的 HACKTRACE 框架,实现高精度低延迟检测并在 GRPO 训练中有效抑制奖励投机。
提出 HACKTRACE 用生成状态检测并抑制代码奖励作弊
摘要论文提出利用生成状态监督作弊尝试的 HACKTRACE 框架,实现高精度低延迟检测并在 GRPO 训练中有效抑制奖励投机。
用强化学习与成对比较奖励训练对齐审计模型并校准假阳性
摘要系统总结了强化学习训练对齐审计器的核心问题、成对奖励与校准方法及主要结果。
提出 ProRubric,把加性评分聚合改为合取协议以抑制奖励作弊
Protocol-level Rubrics(ProRubric) 研究的是:没有可验证器时,把 rubric 判分合成奖励的方式会不会让优化变成分数更高、回答更差。
提出 BenchShield,用形式化插桩核验 Agent 评测的奖励完整性
BenchShield 是放在 LLM 智能体评测基础设施里的一层插桩,用来让奖励相关轨迹的完整性可以被检查,而不是只看最终分数或评分函数。可执行基准里,智能体的中间动作会改变结果过程后来读取的状态,日志和反馈也会影响后续 rollout。作者认为现有的任务补丁、提示词和事后检测器不能证明某次运行留在预定边界内。
提出 EvoRS,使开放式强化学习的奖励系统随策略在线演化
EvoRS 研究开放式 RL 中奖励系统如何在训练期间保持可靠。写作和角色扮演没有可直接验证的答案,策略一旦适应当前 rubric,奖励会出现黑客、漏掉新行为,以及同查询内更难区分。作者认为只动态改评价标准不够,打分机制和信号组合也会失效。
提出 DoM 激活探针,监控并发现评测中的奖励作弊
摘要论文分析了前沿开源模型在评测中的奖励投机,展示了利用内部激活均值差向量低成本监控与发现投机行为的可行性。
提出 RMB,以多样奖励模型 boosting 缓解 RLHF 奖励作弊
RMB 是一种奖励建模方法:用多样的代理奖励模型加 boosting 聚合,为 RLHF 提供更稳的奖励信号。。
提出 VA-Judger,用人类偏好训练联合音视频奖励模型
VA-Judger 是面向联合音视频生成的思维链全模态奖励模型,用来替代由分维度专家指标拼成的强化学习奖励。
提出 STAR-GRPO,用成对可靠性约束抑制奖励作弊
STAR-GRPO 是一种可靠性优先的组相对优势估计:同一 rollout 的两个评分决定更新强度,任务奖励仍由预指定质量路径选择。