跳到正文
原文
LessWrong·本站收录 · 原文发表

HoneyBench 作者回顾六个月 AI 蜜罐评测的定性观察

Qualitative impressions after creating AI honeypots for six months

AI 导读

HoneyBench 作者回顾了为期六个月设计 AI 蜜罐评测的经历,讨论模型对奖励作弊的自述、评测环境的筛选规则,以及模型行为对情境细节的敏感性。作者表示,在约 800 条基准运行中未发现模型明确识别出这是诚信评测的自述,并据此提出对评测意识的定性看法。作者也说明,这些观察与关于训练方式的推测并非经过独立验证的普遍结论。

阅读原文lesswrong.com