摘要论文揭示多智能体层级委托会导致单模型安全对齐失效,多项前沿模型有害执行大幅增加且单层防御难以奏效。
- 评测与基准arXiv 2607.05462
BioSecBench-Refusal:面向智能体生物安全风险评估的配对基准
提出 BioSecBench-Refusal,评测智能体生物安全拒答是否对准风险
- arXiv
- 2607.05462
- 发表
- 层
- 应用层
- 场景
- 编程 Agent
摘要配对基准显示拒绝多由 API 触发,合法任务常被拒得不少于隐蔽危害。
BioSecBench-Refusal 把生物研发智能体的谨慎程度和识别隐蔽危害的能力放在同一套任务上测量。
摘要潜在链路本身即可改变冻结智能体系统的安全,奖励既能攻击也能修复。
学习得到的潜在通信链路会改变由冻结、对齐智能体组成的系统是否遵从有害请求。。作者研究三种拓扑:双智能体、三级顺序协作,以及双专家加汇总。
已经到底了