风险行为arXiv 2609.27900
论文揭示多智能体委派结构放大 LLM 安全风险
评测多智能体委托结构如何放大模型的安全拒答失效
- arXiv
- 2609.27900
- 发表
- 层
- 应用层
- 场景
- 多智能体
- 被测模型
- Claude-Sonnet-4.6、GPT-5、Gemini-3.1-Pro 等 6 个
- 风险拒答失当
摘要论文揭示多智能体层级委托会导致单模型安全对齐失效,多项前沿模型有害执行大幅增加且单层防御难以奏效。
评测多智能体委托结构如何放大模型的安全拒答失效
摘要论文揭示多智能体层级委托会导致单模型安全对齐失效,多项前沿模型有害执行大幅增加且单层防御难以奏效。
提出 BioSecBench-Refusal,评测智能体生物研发拒答与隐蔽危害识别
BioSecBench-Refusal 把生物研发智能体的谨慎程度和识别隐蔽危害的能力放在同一套任务上测量。
提出 LABSHIELD,评测科学实验室智能体的安全推理与规划