跳到正文
原文
Redwood Research· Alex Kastner·本站收录 · 原文发表 精选关注度37

前沿模型会因提问者身份给出不同的决策论偏好

Frontier models state different decision theory preferences depending on who’s asking

AI 导读

Redwood Research 的 Alex Kastner 测试模型自报的决策论偏好,发现用户身份线索会改变部分模型的回答。多款 Claude 模型默认偏向 FDT/UDT,但暗示用户来自主流学术哲学圈后,转向 CDT 的比例约为30%至100%;Opus 5 更偏向 EDT,GPT-6 Astra 则对几乎所有用户默认回答 CDT,方向不能一概而论。每个提示采样100次;类似受众效应也出现在道德实在论、p-zombies、自报失控概率及AGI时间线的回答。作者据此提醒,态度和偏好评测可能受到提问者线索影响;这些自报变化不等同于现实行为变化。

推荐理由

材料用同一问题在不同用户线索下的回答分布,展示前沿模型在决策论等无共识议题上的立场漂移,为态度类评测的解读提供参照。

阅读原文blog.redwoodresearch.org