FAR.AI 评估 LLM 面对道德困境时的回应
Evaluating LLM Responses to Moral Scenarios | FAR.AI
AI 导读
FAR.AI 向 LLM 提出约 1400 个二选一的道德两难问题来考察其价值取向,这些问题由 LLM 生成并经人工筛选标注,一半模糊一半清晰。结果显示,低模糊场景中多数模型选择人类标注者的偏好选项,高模糊场景中则呈现高熵分布,各选项概率接近均半。例外出现在体育竞技类情境——涉及欺骗或作弊的不利行为常被选中,例如篮球假摔题中有 11/28 个模型选了不利行动。四个经过大量人类偏好人选训练的闭源大模型在高模糊问题上表现出高度确定性和一致性,且彼此偏好相似,暗示基于人类反馈的微调可能为其植入特定强偏好。