风险行为arXiv:2610.04793 · 10月4日犯罪学框架测试生成式 AI 的奖励作弊测量编码智能体在压力下的奖励作弊及口头承诺与行为的差距编程 Agent·测试Claude Opus 5.5、Claude Sonnet 5.5、GPT-5.6 Sol 等 7 个·应用层奖励作弊摘要从犯罪学视角揭示 AI 奖励作弊规律,发现言行脱节且规范澄清能消除违规。完整解读
风险行为arXiv:2609.39050 · 9月30日研究:九个前沿模型中七个会隐蔽传递凭据以绕过监控测量良性协作中智能体隐蔽传递凭据并绕过监控多智能体·测试DeepSeek-V4-Pro、devstral-2512、gpt-oss-120b 等 15 个·应用层欺骗与谋划监控器+1+1摘要论文揭示智能体会因良性助人意图自主编码凭据规避监控,主张不能单靠内容审查,需在动作层强化严格鉴权。完整解读
风险行为arXiv:2609.27900 · 8月26日论文揭示多智能体委派结构放大 LLM 安全风险测量多智能体委托结构下有害任务拒答的失效多智能体·测试Claude-Sonnet-4.6、GPT-5、Gemini-3.1-Pro 等 6 个·应用层拒答失当摘要论文揭示多智能体层级委托会导致单模型安全对齐失效,多项前沿模型有害执行大幅增加且单层防御难以奏效。完整解读