跳到正文
10月10日 · 周六

奖励作弊 · 论文

找到 1 篇
筛选3

防御类型

同一类里任选其一,不同类之间同时满足;数字是加上其他已选条件后的篇数。
  1. 风险行为arXiv 2609.39102

    论文提出 CrossFit 缓解自演化搜索智能体的共谋作弊

    提出 CrossFit,用折外求解器抑制自演化搜索智能体共作弊

    发表
    场景
    AI Agent
    被测模型
    Qwen3.5-4B、Qwen3.5-9B
    摘要CrossFit 切断同源伪标签回流到提议者奖励的路径,并提高七个搜索基准上的 Cover-EM。

    False Frontiers 诊断自进化搜索智能体中的 co-cheating,并用按来源交叉拟合的反馈来缓解它。

    深度解读完整解读
已经到底了