跳到正文
10月8日 · 周四

奖励作弊 · 论文

找到 3 篇
筛选

模型自身风险

防御类型

影响

被测模型厂商

同一类里任选其一,不同类之间同时满足;数字是加上其他已选条件后的篇数。另有 68 篇还没打标签,不在筛选结果里。

另有 40 篇还没有研究类型,暂不在这些分类里。

  1. 分析/可解释性arXiv:2609.33989 ·

    RewardExplainer:用反事实偏好反馈学习奖励模型解释

    AI 导读研究者提出 RewardExplainer,一个通过反事实改写从目标奖励模型获取反馈、并用该反馈优化解释器的框架,使解释器能生成开放式、原子化且可干预的自然语言评分机制。

    测试FsfairX-LLaMA3-RM-v0.1、Skywork-Reward-V2-Qwen3-1.7B、RM-Mistral-7B 等 7 个
    摘要RewardExplainer 用双向反事实反馈训练 RM 解释器,并用以发现偏差、定向微调原 RM。

    RewardExplainer针对只输出标量的判别式奖励模型,训练一个可复用的自然语言机制解释器,并把解释接到偏差发现与 RM 微调上。

    完整解读
  2. 分析/可解释性arXiv:2609.38081 ·

    Hessian Null Space Continuation:在单个神经网络解附近发现大量表征多样性

    HNC 沿 Hessian 近似零空间遍历保持输入输出的权重区域,在 RNN、ViT 与 RL 策略中找到表示或行为不同的解,并在 Boat Race 中露出奖励投机。

    测试64-unit tanh RNN、ViT-S/16、RNN policy (Plume Tracking) 等 5 个
    摘要HNC 在保持函数的局部权重区域里找到表示、动力学或行为不同的解。

    Hessian Null Space Continuation(HNC)用局部曲率,在单个已训练网络周围遍历近似保持输入输出的连通低损失区域,并可用可微目标做引导。作者要回答的是:这个区域里是否真有不同的内部机制,而不只是同一表示的小改动。做法是交替执行零空间内的平坦步与函数匹配损失上的梯度恢复。

    完整解读
已经到底了