摘要论文证实了拓扑条件后门的可训练性与泛化性,展示了常规评测盲区,并提出差异化拓扑审计作为检测防御方向。
- 评测与基准arXiv 2609.39146
MADBench:多智能体辩论安全性评测基准发布
发布 MADBench,评测多智能体辩论会吸收还是放大对抗影响
- arXiv
- 2609.39146
- 发表
- 层
- 应用层
- 场景
- 多智能体
摘要MADBench 显示辩论能吸收部分准确率攻击,同时放大未授权读写。
MADBench 是一个评测多智能体辩论安全性的基准,用来看攻击是被辩论吸收还是被放大。
- 攻击arXiv 2609.38270
VirusCascade:劫持 LLM 推荐智能体的协同反思机制
提出 VirusCascade,劫持推荐智能体协同反思以定向推广物品
- arXiv
- 2609.38270
- 发表
- 层
- 应用层
- 场景
- 多智能体
已经到底了