跳到正文
原文
论文追踪· arXiv:2610.05461·本站收录 · 原文发表

研究:认知偏差可削弱辩论式 AI 安全监督

AI Safety via Debate is Compromised by Cognitive Biases

AI 导读

一项研究检验了辩论式 AI 安全监督的核心前提,即真实论证在对抗审查下比虚假论证更易辩护。研究者构造了 68 段由大语言模型生成、凶手已知的侦探谜题对话,并施加锚定、谬误监督、术语堆砌和冗长化四类干预,分别用于主张真凶或主张无辜嫌疑人一方。在 369 名参与者的实验中,跨偏差类型汇总后,这些干预显著将判断推向被操纵的一方。研究据此指出,辩论式监督存在脆弱性:人类裁决对操纵性修辞策略敏感。

阅读原文arxiv.org