跳到正文
原文
论文追踪· arXiv:2610.02303·本站收录 · 原文发表

PowerBench 评测 24 个模型在权力转移请求上的偏见

PowerBench: Measuring Language Model Bias in Power-shifting Requests

AI 导读

研究者提出 PowerBench,用于评测语言模型在权力转移类请求上的系统性差异,把请求分为自我赋权、去权和夺权三类,并设置不改变权力的拒答诱导请求作为对照。数据集在权力领域、情境、受影响方规模和用户原有权力地位上做变化,覆盖 24 个模型(12 个来自美国开发者、12 个来自中国开发者),在用户与受影响方国籍互换、AI 智能体作为用户、8 种请求语言三种条件下评测。结果显示模型对夺权的拒答多于去权,对去权的拒答多于自我赋权;夺权拒答率随受影响方规模从个人上升到社会而提高。模型倾向于帮助他人从美国夺取权力,而不愿帮助美国用户从他人处夺取权力,但在美国获得权力且无人受损时偏向美国。当用户是 AI 智能体时,对权力转移请求的拒答增加,在针对个人的夺权上尤为明显。

阅读原文arxiv.org