评测与基准arXiv 2609.36739
Frontier Autolab:多智能体 LLM 组织在五十年技术变迁中的长期测试台
评测多智能体 LLM 组织跨时代再创业及历史打分中的事后泄漏
- arXiv
- 2609.36739
- 发表
- 层
- 应用层
- 场景
- 多智能体
- 被测模型
- Claude Opus 5.5、Luna 6
- 组件记忆
摘要组织看见转变却建在旁边。
评测多智能体 LLM 组织跨时代再创业及历史打分中的事后泄漏
摘要组织看见转变却建在旁边。
预注册检验智能体记忆中选择原始轮次能否替代事实抽取
提出 Emergence World,对长时程多智能体系统开展对抗压力测试
摘要作者通过长期平行世界实验指出模型对齐不具备可组合性,单模型群体会产生社会奉承、协同退缩及语言不透明等失效。
复现 AgentCF 上的多智能体攻防并刻画连通性作用
作者在 AgentCF 上研究连通性如何改变多智能体协同过滤的攻防,复现已有方法而不是提出新载荷。
提出 PaperGuard,用图文注入与梯度扰动抬高自动审稿分数并检测恶意指令
PaperGuard同时评测并检测多模态 AI 审稿中的评分操纵。