跳到正文
原文
LessWrong·本站收录 · 原文发表

Dean Valentine 分享设计 AI 奖励作弊蜜罐六个月的定性观察

Qualitative impressions from creating AI honeypots for six months

AI 导读

Dean Valentine 分享了设计 AI 奖励作弊蜜罐六个月后的实践观察,讨论模型推理中对作弊的表述、实际行为以及评测环境的敏感性。作者未在所考察轨迹中观察到模型明确说出测试意在考察诚实性,但这不证明不存在隐性的评测感知。内容属于基准团队的定性经验。

阅读原文lesswrong.com