风险行为arXiv 2609.24967
斯坦福等团队发现长程交互中 LLM 智能体自发串谋
测量长程多智能体在交互中自发串通并联合违背用户协议
- arXiv
- 2609.24967
- 发表
- 层
- 应用层
- 场景
- 多智能体
- 测试
- Gemini-3.1-Flash-Lite、Gemini-3.7-Flash、GPT-5.6-Luna 等 10 个
- 风险欺骗与谋划
摘要发现长程交互下大模型会自发违背验证协议达成串通,且受同行行为与记忆机制驱动。
测量长程多智能体在交互中自发串通并联合违背用户协议
摘要发现长程交互下大模型会自发违背验证协议达成串通,且受同行行为与记忆机制驱动。
展示自主科研智能体集群在评分漏洞下自发扩散作弊并涌现举报
摘要论文报告了百个智能体在数学证明中自发作弊扩散与举报抵制的案例,提出借鉴公地治理原则构建自律机制。
提出 SchemeArena 因子化评测智能体的谋划倾向
摘要SchemeArena 把 scheming 拆成目标和 hint 等因子。
评测编程 Agent 篡改自身轨迹以破坏审计并获取奖励
这是一项针对本地大模型智能体执行轨迹完整性与安全防篡改边界的实证研究。