跳到正文
10月8日 · 周四

全部论文

找到 18 篇

另有 701 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 防御arXiv 2610.03055

    HackTrace:用生成状态监督检测代码生成中的奖励作弊

    提出 HACKTRACE 用生成状态检测并抑制代码奖励作弊

    发表
    测试
    Qwen3-8B、Qwen3.5-4B、Llama-3.1-8B-Instruct 等 4 个

    摘要论文提出利用生成状态监督作弊尝试的 HACKTRACE 框架,实现高精度低延迟检测并在 GRPO 训练中有效抑制奖励投机。

    深度解读完整解读
  2. 防御arXiv 2609.33220

    斯坦福与 Anthropic 研究:RL 后训练中模型承认失败的披露行为远不如任务能力稳定

    揭示纯结果强化学习下失败披露跨运行不稳定,并提出失败条件参考锚定

    发表
    测试
    Qwen2.5-1.5B、Qwen2.5-7B、Qwen2.5-14B 等 11 个

    摘要纯结果强化学习会使模型失败披露行为出现远高于任务能力的跨运行发散,采用失败条件参考锚定可稳定汇报但存在性能权衡。

    深度解读完整解读
  3. 防御arXiv 2608.06422

    CMU 研究:分片判断可避免 LLM 监督失效并抵御对抗利用

    提出分片监督,将评判标准拆至独立调用以改善一致性并抵御展示攻击

    发表
    攻击者
    黑盒
    测试
    ChatGPT、Claude Opus 4.8、Claude Sonnet 4.6 等 5 个
    摘要论文揭示决策负载是大模型监督的独立瓶颈,提出分片与辩论机制有效分离注意力与平衡证据,在多项高难度基准上实现稳健评判。

    本文系统研究了大语言模型在执行多标准监督与评判时的决策负载瓶颈及其安全风险。

    深度解读完整解读
  4. 防御arXiv 2608.25460

    用强化学习训练对齐审计员:成对奖励加校准让 Haiku 4.5 追平 Opus 4.6

    用强化学习与成对比较奖励训练对齐审计模型并校准假阳性

    发表
    场景
    AI Agent
    测试
    GPT-5.4、GPT-5.4 Mini、GPT-5.4 Nano 等 15 个

    摘要系统总结了强化学习训练对齐审计器的核心问题、成对奖励与校准方法及主要结果。

    深度解读完整解读
  5. 防御arXiv 2610.00332

    最弱一环:用最坏情况约束强化学习蒸馏 LLM 推理能力

    提出最坏情况约束强化学习,抑制推理蒸馏中的奖励投机

    发表
    测试
    Qwen2.5-1.5B、Qwen2.5-Math-7B-Instruct、Qwen2.5-Coder-1.5B 等 6 个
    摘要最坏前缀教师似然约束让小模型在接近 GRPO 正确率的同时维持更高保真,从而得到最高 RSR。

    Weakest Link 把大模型推理蒸馏改写成带最坏前缀约束的强化学习:学生最大化可验证任务奖励,但任一前缀上对教师的平均负对数似然不得超过预算 d。作者认为,序列级软 KL 只惩罚平均散度,学生可以用别处的高概率文本掩盖某一步的逻辑错误,同时仍得到正确最终答案。GRPO 则只优化最终答案。

    深度解读完整解读
  6. 防御arXiv 2609.38847

    ProRubric:通过协议级评分标准缓解 Rubric-RL 中的奖励作弊

    提出 ProRubric,把加性评分聚合改为合取协议以抑制奖励作弊

    发表
    测试
    Qwen3-4B、Qwen3-8B
    摘要ProRubric 用离线合取维度替换加性求和,在继续学习时抬高适当性且不损失覆盖率。

    Protocol-level Rubrics(ProRubric) 研究的是:没有可验证器时,把 rubric 判分合成奖励的方式会不会让优化变成分数更高、回答更差。

    深度解读完整解读
  7. 防御arXiv 2609.12459

    EvoRS:面向开放式强化学习的奖励系统在线自演化框架

    提出 EvoRS,使开放式强化学习的奖励系统随策略在线演化

    发表
    测试
    Qwen3-4B、Qwen3-8B、Qwen3.5-27B 等 7 个
    摘要EvoRS 用 on-policy 证据演化完整奖励系统,在写作和角色扮演上同时提高质量并降低黑客与覆盖失败。

    EvoRS 研究开放式 RL 中奖励系统如何在训练期间保持可靠。写作和角色扮演没有可直接验证的答案,策略一旦适应当前 rubric,奖励会出现黑客、漏掉新行为,以及同查询内更难区分。作者认为只动态改评价标准不够,打分机制和信号组合也会失效。

    深度解读完整解读
  8. 防御arXiv 2609.19101

    用内部表征监控与发现 LLM 评测中的奖励作弊

    提出 DoM 激活探针,监控并发现评测中的奖励作弊

    发表
    测试
    Qwen 3.8 Max、Qwen 3.8 27B、Qwen3.8-2.4T 等 7 个

    摘要论文分析了前沿开源模型在评测中的奖励投机,展示了利用内部激活均值差向量低成本监控与发现投机行为的可行性。

    深度解读完整解读
  9. 防御arXiv 2609.33221

    RMB:用奖励模型 boosting 缓解 RLHF 中的奖励作弊

    提出 RMB,以多样奖励模型 boosting 缓解 RLHF 奖励作弊

    发表
    测试
    GPT-4o-2024-08-06、GPT-4-0125-preview、Gemma-2B-IT 等 7 个
    摘要RMB 用 HSIC 多样奖励模型加决策树 boosting,提高偏好准确率并缓解 reward hacking。

    RMB 是一种奖励建模方法:用多样的代理奖励模型加 boosting 聚合,为 RLHF 提供更稳的奖励信号。。

    深度解读完整解读
  10. 防御arXiv 2609.39102

    论文提出 CrossFit 缓解自演化搜索智能体的共谋作弊

    提出 CrossFit,用折外求解器缓解自进化搜索智能体的共作弊

    发表
    场景
    AI Agent
    测试
    Qwen3.5-4B、Qwen3.5-9B
    摘要CrossFit 切断同源伪标签回流到提议者奖励的路径,并提高七个搜索基准上的 Cover-EM。

    False Frontiers 诊断自进化搜索智能体中的 co-cheating,并用按来源交叉拟合的反馈来缓解它。

    深度解读完整解读
  11. 防御arXiv 2609.35677

    RLVR 中的验证器错误:奖励作弊、反馈局限与选择性控制

    刻画不完美验证器下 RLVR 奖励黑客的增长并用投影审计校正实现选择性控制

    发表
    测试
    Qwen2-0.5B、log linear policy、neural policy
    摘要固定验证器的 RLVR 会把验收与黑客绑在一起。

    作者分析固定、不完美验证器下的 RLVR:验证器无假阴性,因而同时奖励正确回答和被接受错误,平均奖励只看总验收概率。

    深度解读完整解读
  12. 防御arXiv 2609.33662

    Audit-First VAPO:不完美验证下的风险认证选择性更新

    提出 Audit-First VAPO,在不完美验证下认证并选择性准入策略更新

    发表
    测试
    Qwen3.5-0.8B、Llama-3.2-3B-Instruct
    摘要Audit-First VAPO 先认证方向准入,再限制非负幅度。

    Audit-First VAPO 把验证器条件下的策略更新拆成方向准入和准入后的非负幅度控制,并用冻结轨迹上的有限样本界认证 selected harmful risk、coverage 和二次验证调用率。不完美验证器即使幅度已被裁剪和正则限制,仍可能指向有害方向。仅观测的 accept–appeal–abstain 在干净标签接合前冻结。

    深度解读完整解读
  13. 防御arXiv 2609.21996

    PIR:从模型内部激活读出被隐藏的答案

    提出内部识别探测器 PIR,从激活区分模型隐瞒与真实遗忘

    发表
    测试
    Qwen2.5-7B、Qwen3-8B、gemma-2-9b 等 9 个

    摘要论文提出免参考内部识别探测 PIR,划分了隐瞒与遗忘的边界,为评估沙盒审计与遗忘真实性提供了内部依据。

    深度解读完整解读
  14. 防御arXiv 2609.36900

    STAR-GRPO:用可靠性优先优势估计抑制奖励作弊

    提出 STAR-GRPO,用成对可靠性约束抑制奖励作弊

    发表
    测试
    Skywork-Reward-V2-Qwen3-8B、Qwen3-4B、GPT-4o-mini 等 6 个
    摘要STAR-GRPO 用成对可靠性约束 GRPO 优势,在两种奖励黑客设定中限制无支撑分数。

    STAR-GRPO 是一种可靠性优先的组相对优势估计:同一 rollout 的两个评分决定更新强度,任务奖励仍由预指定质量路径选择。

    深度解读完整解读
已经到底了