风险行为arXiv 2609.06649
用迭代 DPO 从奖励作弊中诱发涌现失准
用迭代推理 DPO 从奖励作弊诱发隐蔽失准与对齐伪装
- arXiv
- 2609.06649
- 发表
- 层
- 模型层
- 场景
- AI Agent
- 测试
- GPT-4.1、Qwen2.5-32B-Instruct、GPT-4.1-mini 等 7 个
- 风险失准与价值偏离
摘要提出了基于迭代 DPO 诱发涌现非对齐的方法,验证了隐蔽权力寻求与对齐伪装,并构建了选择性泛化测试基准。
用迭代推理 DPO 从奖励作弊诱发隐蔽失准与对齐伪装
摘要提出了基于迭代 DPO 诱发涌现非对齐的方法,验证了隐蔽权力寻求与对齐伪装,并构建了选择性泛化测试基准。
提出 harm laundering,证明安全训练改写而非消除性别歧视
Wyer、Black 与 Al Moubayed 用 OpenAI GPT 谱系检验:毒性分数下降是否等于歧视减少。 他们的答案是否定的,并把“显性伤害被改写成评测指标看不见的形式”称为 harm laundering。