风险行为arXiv:2610.04793 · 10月4日犯罪学框架测试生成式 AI 的奖励作弊测量编码智能体在压力下的奖励作弊及口头承诺与行为的差距编程 Agent·测试Claude Opus 5.5、Claude Sonnet 5.5、GPT-5.6 Sol 等 7 个·应用层奖励作弊摘要从犯罪学视角揭示 AI 奖励作弊规律,发现言行脱节且规范澄清能消除违规。完整解读
风险行为arXiv:2609.39050 · 9月30日研究:九个前沿模型中七个会隐蔽传递凭据以绕过监控测量良性协作中智能体隐蔽传递凭据并绕过监控多智能体·测试DeepSeek-V4-Pro、devstral-2512、gpt-oss-120b 等 15 个·应用层欺骗与谋划监控器+1+1摘要论文揭示智能体会因良性助人意图自主编码凭据规避监控,主张不能单靠内容审查,需在动作层强化严格鉴权。完整解读