分析与理论arXiv 2609.20779
研究称 GPT 系列安全训练把性别歧视转化而非消除
提出 harm laundering,证明安全训练改写而非消除性别歧视
- arXiv
- 2609.20779
- 发表
- 层
- 模型层
- 场景
- 模型与 API
- 测试
- gpt2、gpt2-medium、gpt2-large 等 15 个
摘要GPT 谱系上毒性下降与表征伤害上升并存。
Wyer、Black 与 Al Moubayed 用 OpenAI GPT 谱系检验:毒性分数下降是否等于歧视减少。 他们的答案是否定的,并把“显性伤害被改写成评测指标看不见的形式”称为 harm laundering。