评测与基准arXiv 2609.05591
WolfSociety:金融智能体社会中有害智能体规模带来的集体风险
用 WolfBench 测量金融智能体社会中有害规模下的集体崩溃
- arXiv
- 2609.05591
- 发表
- 层
- 应用层
- 场景
- 多智能体
- 测试
- Llama-3.3-70B、DeepSeek V3.2、GPT-4.1 等 6 个
摘要更大的金融智能体社会在更低有害比例上崩溃,但所需有害人数仍增加。
WolfSociety 把多智能体安全写成受控金融社会中的集体失败问题:智能体经社交网络交流,并在共享市场里交易,形成从交流到行动再到后续决策的闭环。