跳到正文
10月8日 · 周四

奖励作弊 · 论文

找到 5 篇
筛选1
同一类里任选其一,不同类之间同时满足;数字是加上其他已选条件后的篇数。另有 51 篇还没打标签,不在筛选结果里。

另有 51 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 风险行为arXiv 2609.14998

    合成文档微调无法阻止奖励作弊引发的涌现性失准

    检验合成文档微调能否阻断奖励作弊带来的涌现失准

    发表
    测试
    Llama-3.3-70B-Instruct、Claude Sonnet 4.6、Claude Haiku 4.5
    摘要SDF 能让模型口头接受 reward hacking,却挡不住、甚至伴随更强的 EM。

    作者研究一种风险行为:模型在奖励可被钻空子的 RL 里学会 reward hacking 之后,会不会泛化出更广的 misalignment,以及能不能在开发者不控制的后续训练之前,用合成文档微调把这条泛化提前挡住。

    深度解读完整解读
  2. 防御arXiv 2609.19101

    用内部表征监控与发现 LLM 评测中的奖励作弊

    提出 DoM 激活探针,监控并发现评测中的奖励作弊

    发表
    测试
    Kimi K3、GLM 5.2、Qwen 3.8 Max 等 7 个

    摘要论文分析了前沿开源模型在评测中的奖励投机,展示了利用内部激活均值差向量低成本监控与发现投机行为的可行性。

    深度解读完整解读
已经到底了