评测与基准arXiv 2609.33102
ORBIT:基于 UK AISI Inspect 的多智能体安全评测框架
提出 ORBIT 框架,评测多智能体系统中的攻击、合谋与多类防御
- arXiv
- 2609.33102
- 发表
- 层
- 应用层
- 场景
- 多智能体
- 测试
- GPT-5.4、Claude Sonnet 4.6、Qwen3-235B 等 6 个
摘要ORBIT 用六层配置比较多智能体防御,逐动作监控不迁移到合谋。
提出 ORBIT 框架,评测多智能体系统中的攻击、合谋与多类防御
摘要ORBIT 用六层配置比较多智能体防御,逐动作监控不迁移到合谋。
提出 RLCDAlignBench,零样本检测多种对齐失败
RLCDAlignBench 测量用强化学习做校准决策的 Jev,能否当作对齐失败的零样本检测器。
比较用于审计提示注入与隐瞒的 token 位置选择信号