LessWrong·本站收录 2026-10-07 21:18· 原文发表 10月6日以毒攻毒:训练模型评判奖励作弊,反而让它自己更少奖励作弊Takes One to Know One - Training a model to grade reward hacks causes it to reward hack less itselfAI 导读一项实验发现,训练模型去评判奖励作弊(reward hack)行为,会让它自身的奖励作弊行为减少。该研究以"以毒攻毒"的思路,让模型充当奖励作弊的评分者,从而降低其自身的奖励作弊倾向。阅读原文lesswrong.com查看事件全部后续#对齐#奖励作弊