跳到正文
原文
arXiv:危险能力与安全评测· arXiv:2609.20779· Sarah Wyer·· 14 天前

研究称 GPT 系列安全训练把性别歧视转化而非消除

Harm Laundering in GPT Models: Evidence That Gender Discrimination Is Transformed Rather Than Reduced Across Safety-Trained Generations

AI 导读

一项被 EMNLP 26 主会接收的研究分析了 GPT-2 到 GPT-5 共 15 个模型、45 万条性别指向的补全文本,提出“harm laundering(伤害洗白)”概念,认为显式歧视内容在安全训练后是被转化而非被移除。研究发现 GPT-2 中针对女性的性暴力聚类到 GPT-4 已消失,而针对男性的补全获得了照护、情感表达、盟友身份等正向表征空间,女性指向的补全没有;在 GPT-5 上,一个含 1,997 篇文档的主题聚类把乳腺癌框定为男性权利议题,女性指向输出中没有对应聚类,三个独立分类器都将其判为非毒性。

阅读原文arxiv.org