CIAware-Bench 作者讨论控制干预感知评测的新结果
CIAware-Bench 更新讨论:作者报告更强的干预感知,并明确仅测试 prompted awareness
AI 导读
Alexander Panfilov 讨论 CIAware-Bench 的控制干预感知评测,报告近期前沿模型在所测设置中表现更强。他明确说明,当前仅测试模型受到明确提问时能否识别干预。结果不能直接推出模型会自发察觉干预、真实部署中的发生率,或所有控制方法普遍失效。
推荐理由
CIAware-Bench 更新显示前沿模型干预感知大幅提升,对 AI 控制协议的有效性构成直接挑战。