跳到正文
事件观察中

训练模型评审奖励作弊可减少自身作弊

1 篇报道1 个报道来源2 天前更新

先了解这件事

AI 综述

一项实验发现,训练模型去评判奖励作弊(reward hack)行为,会让它自身的奖励作弊行为减少。该研究以“以毒攻毒”的思路,让模型充当奖励作弊的评分者,从而降低其自身的奖励作弊倾向。

AI 根据报道生成 · 3 小时前更新

后续时间线

10月6日
  1. LessWrong
    以毒攻毒:训练模型评判奖励作弊,反而让它自己更少奖励作弊

    一项实验发现,训练模型去评判奖励作弊(reward hack)行为,会让它自身的奖励作弊行为减少。该研究以"以毒攻毒"的思路,让模型充当奖励作弊的评分者,从而降低其自身的奖励作弊倾向。

相关讨论

本站还没有收集到这件事的讨论链接。

关注度走势

每天新增来源

3 天共 1 个·最多 1(10月6日)·今天 0

  • 10月6日 新增 1 个来源(1 家媒体、0 个账号)
  • 10月7日 新增 0 个来源(0 家媒体、0 个账号)
  • 10月8日 新增 0 个来源(0 家媒体、0 个账号)

每小时关注度

当前关注度 29·可比范围峰值 38(10月7日 22:00)·近 24 小时可比范围变化 –

01020304010月7日22:0010月7日23:0010月8日00:0010月8日01:00