风险行为arXiv:2610.04793 · 10月4日犯罪学框架测试生成式 AI 的奖励作弊测量编码智能体在压力下的奖励作弊及口头承诺与行为的差距编程 Agent·测试Claude Opus 5.5、Claude Sonnet 5.5、GPT-5.6 Sol 等 7 个·应用层奖励作弊摘要从犯罪学视角揭示 AI 奖励作弊规律,发现言行脱节且规范澄清能消除违规。完整解读