风险行为arXiv 2609.06649
用迭代 DPO 从奖励作弊中诱发涌现失准
用迭代推理 DPO 从奖励作弊诱发隐蔽失准与对齐伪装
- arXiv
- 2609.06649
- 发表
- 层
- 模型层
- 场景
- AI Agent
- 测试
- GPT-4.1、Qwen2.5-32B-Instruct、GPT-4.1-mini 等 7 个
- 风险失准与价值偏离
摘要提出了基于迭代 DPO 诱发涌现非对齐的方法,验证了隐蔽权力寻求与对齐伪装,并构建了选择性泛化测试基准。
用迭代推理 DPO 从奖励作弊诱发隐蔽失准与对齐伪装
摘要提出了基于迭代 DPO 诱发涌现非对齐的方法,验证了隐蔽权力寻求与对齐伪装,并构建了选择性泛化测试基准。
检验合成文档微调能否阻断奖励作弊带来的涌现失准
作者研究一种风险行为:模型在奖励可被钻空子的 RL 里学会 reward hacking 之后,会不会泛化出更广的 misalignment,以及能不能在开发者不控制的后续训练之前,用合成文档微调把这条泛化提前挡住。