评测与基准arXiv 2609.33102
ORBIT:基于 UK AISI Inspect 的多智能体安全评测框架
提出 ORBIT 框架,评测多智能体防御对合谋等威胁的效果
- arXiv
- 2609.33102
- 发表
- 层
- 应用层
- 场景
- 多智能体
- 被测模型
- GPT-5.4、Claude Sonnet 4.6、Qwen3-235B 等 5 个
摘要ORBIT 用六层配置比较多智能体防御,逐动作监控不迁移到合谋。
提出 ORBIT 框架,评测多智能体防御对合谋等威胁的效果
摘要ORBIT 用六层配置比较多智能体防御,逐动作监控不迁移到合谋。
测试编程智能体被诱导或自主篡改自身执行轨迹的行为
这是一项针对本地大模型智能体执行轨迹完整性与安全防篡改边界的实证研究。
提出 GUARD,在零样本 TTS 上用激活转向遗忘说话人身份以阻止再识别
GUARD 用门控激活转向做说话人身份遗忘,使零样本 TTS 对退出说话人难以再识别。