评测与基准arXiv 2608.03421
ForesightSafety-TIDE
提出 ForesightSafety-TIDE,评测多智能体在单点欺骗下的集体事实恢复
- arXiv
- 2608.03421
- 发表
- 层
- 应用层
- 场景
- 多智能体
- 测试
- GPT-5.5、DeepSeek-v4-pro、Grok-4.5
- 风险欺骗与谋划
提出 ForesightSafety-TIDE,评测多智能体在单点欺骗下的集体事实恢复
用 WolfBench 测量金融智能体社会中有害规模下的集体崩溃
WolfSociety 把多智能体安全写成受控金融社会中的集体失败问题:智能体经社交网络交流,并在共享市场里交易,形成从交流到行动再到后续决策的闭环。