跳到正文

奖励作弊

训练与部署中的奖励作弊、规格博弈与测试作弊。

41条精选相关主题对齐欺骗与谋划安全评测

最新精选

第 41–41 条 · 共 41 条
9月30日周三
  1. DeepMind Safety Research · 收录 · 原文 33

    DeepMind 提出预测 RL 训练何时破坏思维链可监控性的框架

    DeepMind Safety Research 提出一个概念框架,按输出奖励与思维链奖励的关系把训练环境分为冲突、正交、对齐三类,用于在训练前预测 RL 是否会破坏思维链可监控性。

    推荐理由提出按奖励冲突类型预判 RL 训练是否破坏思维链可监控性的框架,并在代码后门与抛硬币任务上验证。