评测与基准arXiv 2609.36739
Frontier Autolab:多智能体 LLM 组织在五十年技术变迁中的长期测试台
评测多智能体 LLM 组织跨时代再创业及历史打分中的事后泄漏
- arXiv
- 2609.36739
- 发表
- 层
- 应用层
- 场景
- 多智能体
- 被测模型
- Claude Opus 5.5、Luna 6
- 组件记忆
摘要组织看见转变却建在旁边。
评测多智能体 LLM 组织跨时代再创业及历史打分中的事后泄漏
摘要组织看见转变却建在旁边。
提出 ORBIT 框架,评测多智能体防御对合谋等威胁的效果
摘要ORBIT 用六层配置比较多智能体防御,逐动作监控不迁移到合谋。
提出 Emergence World,对长时程多智能体系统开展对抗压力测试
摘要作者通过长期平行世界实验指出模型对齐不具备可组合性,单模型群体会产生社会奉承、协同退缩及语言不透明等失效。
复现 AgentCF 上的多智能体攻防并刻画连通性作用
作者在 AgentCF 上研究连通性如何改变多智能体协同过滤的攻防,复现已有方法而不是提出新载荷。
提出多轮在线骚扰 Agent 基准,评测记忆、规划与微调越狱
提出 SafeScientist 四层监控,阻止科研智能体执行高风险或不伦理任务
SafeScientist 是带四层监控的科研智能体框架,并用 SciSafetyBench 评测科学场景中的任务安全。