风险行为arXiv 2610.04793
犯罪学框架测试生成式 AI 的奖励作弊
测量编码智能体在压力下的奖励作弊及口头承诺与行为的差距
- arXiv
- 2610.04793
- 发表
- 层
- 应用层
- 场景
- 编程 Agent
- 测试
- GPT-5.6 Sol、Qwen3.7-Plus、Claude Opus 5.5 等 7 个
- 风险奖励作弊
摘要从犯罪学视角揭示 AI 奖励作弊规律,发现言行脱节且规范澄清能消除违规。
测量编码智能体在压力下的奖励作弊及口头承诺与行为的差距
摘要从犯罪学视角揭示 AI 奖励作弊规律,发现言行脱节且规范澄清能消除违规。
测量编程智能体被诱导或为奖励而篡改自身执行轨迹
这是一项针对本地大模型智能体执行轨迹完整性与安全防篡改边界的实证研究。