跳到正文
10月9日 · 周五

奖励作弊 · 论文

找到 5 篇
筛选4
同一类里任选其一,不同类之间同时满足;数字是加上其他已选条件后的篇数。另有 20 篇还没打标签,不在筛选结果里。

另有 20 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 分析与理论arXiv 2610.03196

    研究:人形机器人学习流程四层代理均存在偏离,不止奖励作弊

    论证腿式 RL 四层代理在目标缺失时仍报成功

    发表
    测试
    Gaussian MLP(三隐层各 128 ELU,独立 critic,PPO)
    摘要四层都可能在目标缺失时报告成功。

    作者讨论腿式机器人 RL 流水线中,奖励、课程门控、评测统计量和参考运动如何在物理目标缺失时仍报告成功。传统观点只把奖励当作会被优化、因而会偏离的代理。

    深度解读完整解读
  2. 防御arXiv 2609.31855

    PHIRL:将学习到的奖励与任务进度对齐的逆强化学习框架

    提出 PHIRL,将逆强化学习奖励与任务进度四维对齐

    发表
    测试
    PHIRL、PHIRL-online、AIRL 等 8 个
    摘要PHIRL 用进度四维对齐 AIRL 奖励。

    PHIRL 用进度标注修正从示范反推的奖励,以减少真人在环,同时不把示范中的每一步都当成任务进展。

    深度解读完整解读
  3. 防御arXiv 2609.39102

    论文提出 CrossFit 缓解自演化搜索智能体的共谋作弊

    提出 CrossFit,用折外求解器缓解自进化搜索智能体的共作弊

    发表
    场景
    AI Agent
    测试
    Qwen3.5-4B、Qwen3.5-9B
    摘要CrossFit 切断同源伪标签回流到提议者奖励的路径,并提高七个搜索基准上的 Cover-EM。

    False Frontiers 诊断自进化搜索智能体中的 co-cheating,并用按来源交叉拟合的反馈来缓解它。

    深度解读完整解读
  4. 评测与基准arXiv 2609.39533

    CATCH:面向编码 RL 奖励作弊的可控分析测试台

    提出 CATCH 测试台,复现编码 RL 的奖励作弊

    发表
    测试
    Qwen3-4B、Qwen3.5-Plus、Qwen3.5-27B
    摘要CATCH 用双运行金标签研究编码 RL 的奖励黑客,并观察到监控会被注释适应削弱。

    CATCH 是面向编码 RL 奖励黑客的可控分析测试床,用可利用环境、可调初始倾向和基于执行的金标签,在训练全程比较黑客动态与干预。

    深度解读完整解读
已经到底了