研究称 GPT 系列安全训练把性别歧视转化而非消除
Harm Laundering in GPT Models: Evidence That Gender Discrimination Is Transformed Rather Than Reduced Across Safety-Trained Generations
AI 导读
一项被 EMNLP 26 主会接收的研究分析了 GPT-2 到 GPT-5 共 15 个模型、45 万条性别指向的补全文本,提出“harm laundering(伤害洗白)”概念,认为显式歧视内容在安全训练后是被转化而非被移除。研究发现 GPT-2 中针对女性的性暴力聚类到 GPT-4 已消失,而针对男性的补全获得了照护、情感表达、盟友身份等正向表征空间,女性指向的补全没有;在 GPT-5 上,一个含 1,997 篇文档的主题聚类把乳腺癌框定为男性权利议题,女性指向输出中没有对应聚类,三个独立分类器都将其判为非毒性。