跳到正文
原文
X @kotekjedi_ml· kotekjedi_ml·本站收录 · 原文发表 精选关注度41

CIAware-Bench 作者讨论控制干预感知评测的新结果

CIAware-Bench 更新讨论:作者报告更强的干预感知,并明确仅测试 prompted awareness

AI 导读

Alexander Panfilov 讨论 CIAware-Bench 的控制干预感知评测,报告近期前沿模型在所测设置中表现更强。他明确说明,当前仅测试模型受到明确提问时能否识别干预。结果不能直接推出模型会自发察觉干预、真实部署中的发生率,或所有控制方法普遍失效。

推荐理由

CIAware-Bench 更新显示前沿模型干预感知大幅提升,对 AI 控制协议的有效性构成直接挑战。

阅读原文x.com