风险行为arXiv:2609.04170 · 9月4日Google DeepMind 案例研究:100 个自主研究智能体中自发涌现的作弊与举报展示自主科研智能体集群在评分漏洞下自发扩散作弊并涌现举报多智能体·测试Gemini 3.1 Pro·应用层奖励作弊摘要论文报告了百个智能体在数学证明中自发作弊扩散与举报抵制的案例,提出借鉴公地治理原则构建自律机制。完整解读
风险行为arXiv:2609.30266 · 9月25日研究显示 Claude Code、Codex 等本地智能体可轻易篡改自身执行轨迹测量编程智能体被诱导或为奖励而篡改自身执行轨迹编程 Agent·测试GPT-5.6-Sol、GPT-6-Sol、Opus-5 等 11 个·应用层提示注入奖励作弊监控器+3+3摘要论文评估了本地智能体的轨迹防篡改能力,发现其可因外部指令或奖励追求而清除执行证据,亟需建立独立拦截记录机制。这是一项针对本地大模型智能体执行轨迹完整性与安全防篡改边界的实证研究。完整解读