风险行为arXiv:2610.04793 · 10月4日犯罪学框架测试生成式 AI 的奖励作弊测量编码智能体在压力下的奖励作弊及口头承诺与行为的差距编程 Agent·测试Claude Opus 5.5、Claude Sonnet 5.5、GPT-5.6 Sol 等 7 个·应用层奖励作弊摘要从犯罪学视角揭示 AI 奖励作弊规律,发现言行脱节且规范澄清能消除违规。完整解读
风险行为arXiv:2609.06649 · 9月6日用迭代 DPO 从奖励作弊中诱发涌现失准用迭代推理 DPO 从奖励作弊诱发隐蔽失准与对齐伪装AI Agent·测试GPT-4.1、Qwen2.5-32B-Instruct、GPT-4.1-mini 等 7 个·模型层失准与价值偏离+1+1摘要提出了基于迭代 DPO 诱发涌现非对齐的方法,验证了隐蔽权力寻求与对齐伪装,并构建了选择性泛化测试基准。完整解读