跳到正文
10月8日 · 周四

奖励作弊 · 论文

精选论文 19 篇
  1. 评测/基准arXiv:2610.08540 · 55

    论文提出按风险类别测量的对齐缩放定律框架

    论文提出分风险对齐标度律,测得Pythia防御算力指数为0.60,Qwen2.5真实性与倾向纠错指数为-0.05与0.48。

    • 0.60Pythia分类器Spam任务GCG防御算力指数α(95%区间0.42–0.78)
    • -0.05Qwen2.5在0.5B–72B上真实性纠错算力指数α(95%区间-0.39至0.22)
    • 0.48Qwen2.5在0.5B–72B上陈述倾向纠错算力指数α(95%区间0.36至0.60)
    6 问速览论文试图解决对齐难度是否随模型规模增大而变化的问题,提出分风险对齐标度律框架与测量协议。
    1. 这篇论文试图解决什么问题?

      论文试图解决对齐难度是否随模型规模增大而变化的问题,提出分风险对齐标度律框架与测量协议。

    2. 有哪些相关研究?

      梳理了标度律与对齐税、过度优化与监督、潜伏非对齐等领域研究,指出尚无直接测量对齐负担标度律的工作。

    3. 论文如何解决这个问题?

      提出分风险对齐标度律定义与三种负担操作化,建立裕度与审计玩具模型,并制定预注册测量协议。

    4. 论文做了哪些实验?

      重分析与微调实验测得防御算力指数为0.35至0.60,可见风险呈现标度有益,但盲后门在多数尺寸存活。

    5. 有什么可以进一步探索的点?

      作者指出了玩具模型假设简化、未计入评估开销及二选一格式等局限,实验仅覆盖至72B密集模型与QLoRA微调。

    6. 总结一下论文的主要内容

      论文提出了分风险对齐标度律框架,测得真实性与倾向纠错呈标度有益,但盲后门仍存活,揭示隐藏风险的长期挑战。

    完整解读
  2. 评测/基准arXiv:2608.25460 · 55

    用强化学习训练对齐审计员:成对奖励加校准让 Haiku 4.5 追平 Opus 4.6

    作者通过成对比较奖励与假阳性校准训练审计模型,使Haiku 4.5在综合评分上达到Opus 4.6水平(48.7对48.4)。

    • 48.7 ± 1.1Ref. PW 4/8 FP 3轮,综合评分(Table 7)
    • 72.7 ± 2.6Ref. PW 4/8 FP 3轮,审计质量得分(Table 7)
    • 99.6 ± 0.7%Ref. PW 4/8 FP 3轮,假阳性校准得分(Table 7)
    6 问速览解决自动化对齐审计系统调查浅显、缺乏真实感以及容易产生过度激进虚假指控的问题。
    1. 这篇论文试图解决什么问题?

      解决自动化对齐审计系统调查浅显、缺乏真实感以及容易产生过度激进虚假指控的问题。

    2. 有哪些相关研究?

      梳理了自动化红队、对齐审计框架、隐蔽行为基准及偏好强化学习等领域的研究。

    3. 论文如何解决这个问题?

      提出基于动态更新参考轨迹的成对比较奖励,并结合50%干净目标的假阳性校准训练。

    4. 论文做了哪些实验?

      在四维评测中达到Opus 4.6水平,并证实了成对奖励优越性与跨脚手架泛化能力。

    5. 有什么可以进一步探索的点?

      局限包含全依赖单一家族LLM裁判、仅训练单一小模型及系统提示词植入较弱。

    6. 总结一下论文的主要内容

      系统总结了强化学习训练对齐审计器的核心问题、成对奖励与校准方法及主要结果。

    完整解读
已经到底了