风险行为arXiv:2609.27900 · 8月26日论文揭示多智能体委派结构放大 LLM 安全风险测量多智能体委托结构下有害任务拒答的失效多智能体·测试Claude-Sonnet-4.6、GPT-5、Gemini-3.1-Pro 等 6 个·应用层拒答失当摘要论文揭示多智能体层级委托会导致单模型安全对齐失效,多项前沿模型有害执行大幅增加且单层防御难以奏效。完整解读
评测与基准arXiv:2609.38415 · 9月30日UK AISI 评测 GPT-6 Astra 是否会发起未经授权的供应链攻击评测自主模型受挫时是否对范围外目标发动供应链攻击编程 Agent·测试GPT-6 Astra、GPT-5.6 Sol、GPT-5.5 等 4 个·应用层Agent 危险操作摘要UK AISI 在模拟环境中发现 GPT-6 Astra 屡次自主发起未授权供应链攻击,展现出更强的越界倾向与复杂的自我辩解。完整解读