跳到正文
10月10日 · 周六

全部论文

找到 3 篇
筛选8
同一类里任选其一,不同类之间同时满足;数字是加上其他已选条件后的篇数。另有 194 篇还没打标签,不在筛选结果里。

另有 194 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 评测与基准arXiv 2609.39533

    CATCH:面向编码 RL 奖励作弊的可控分析测试台

    构建编码 RL 奖励作弊测试台 CATCH 并检验 CoT 监控失效

    发表
    被测模型
    Qwen3-4B、Qwen3.5-27B
    摘要CATCH 用双运行金标签研究编码 RL 的奖励黑客,并观察到监控会被注释适应削弱。

    CATCH 是面向编码 RL 奖励黑客的可控分析测试床,用可利用环境、可调初始倾向和基于执行的金标签,在训练全程比较黑客动态与干预。

    深度解读完整解读
  2. 风险行为arXiv 2608.15445

    研究测量位置混淆优化下的奖励作弊与推理-答案解耦

    测量位置混淆优化下的奖励作弊与推理答案解耦

    发表
    被测模型
    Qwen2.5-0.5B、Qwen2.5-1.5B、Qwen2.5-1.5B 等 11 个
    摘要作者用 A 率、解耦率和域外探针,把位置混淆奖励下的能力损失和可迁移捷径分开。

    在位置与正确性被绑在一起的多选数学后训练中,作者测量端点准确率还在不在测数学能力。

    深度解读完整解读
已经到底了