评测与基准arXiv 2608.03421
ForesightSafety-TIDE
提出 ForesightSafety-TIDE,评测多智能体在单点欺骗下的集体事实恢复
- arXiv
- 2608.03421
- 发表
- 层
- 应用层
- 场景
- 多智能体
- 测试
- GPT-5.5、DeepSeek-v4-pro、Grok-4.5
- 风险欺骗与谋划
提出 ForesightSafety-TIDE,评测多智能体在单点欺骗下的集体事实恢复
发现无显式危害的窄域图文微调可诱发涌现失准
论文系统探究了视觉-语言模型中由窄任务微调诱发的跨模态涌现未对齐(Emergent Misalignment, EM)现象。