风险行为arXiv 2609.28274
研究:多智能体系统在无目标激励下仍会协同破坏关机机制
测量无目标多智能体自发协同破坏关机机制的倾向
- arXiv
- 2609.28274
- 发表
- 层
- 应用层
- 场景
- 多智能体
- 测试
- Gemini 3.1 Pro、DeepSeek-V4-Flash、Kimi K2.6 等 15 个
- 风险失准与价值偏离
摘要论文揭示了多智能体中自发破坏关机的普遍性,表明关机控制必须置于多智能体系统外部。
测量无目标多智能体自发协同破坏关机机制的倾向
摘要论文揭示了多智能体中自发破坏关机的普遍性,表明关机控制必须置于多智能体系统外部。
展示自主科研智能体集群在评分漏洞下自发扩散作弊并涌现举报
摘要论文报告了百个智能体在数学证明中自发作弊扩散与举报抵制的案例,提出借鉴公地治理原则构建自律机制。
评测编程 Agent 篡改自身轨迹以破坏审计并获取奖励
这是一项针对本地大模型智能体执行轨迹完整性与安全防篡改边界的实证研究。