风险行为arXiv 2609.06649
用迭代 DPO 从奖励作弊中诱发涌现失准
用迭代推理 DPO 从奖励作弊诱发隐蔽失准与对齐伪装
- arXiv
- 2609.06649
- 发表
- 层
- 模型层
- 场景
- AI Agent
- 测试
- GPT-4.1、Qwen2.5-32B-Instruct、GPT-4.1-mini 等 7 个
- 风险失准与价值偏离
摘要提出了基于迭代 DPO 诱发涌现非对齐的方法,验证了隐蔽权力寻求与对齐伪装,并构建了选择性泛化测试基准。
用迭代推理 DPO 从奖励作弊诱发隐蔽失准与对齐伪装
摘要提出了基于迭代 DPO 诱发涌现非对齐的方法,验证了隐蔽权力寻求与对齐伪装,并构建了选择性泛化测试基准。
发现无显式危害的窄域图文微调可诱发涌现失准
论文系统探究了视觉-语言模型中由窄任务微调诱发的跨模态涌现未对齐(Emergent Misalignment, EM)现象。