评测与基准arXiv 2609.36739
Frontier Autolab:多智能体 LLM 组织在五十年技术变迁中的长期测试台
提出 Frontier Autolab,评测多智能体组织的跨时代再创业与事后泄漏
- arXiv
- 2609.36739
- 发表
- 层
- 应用层
- 场景
- 多智能体
- 被测模型
- Claude Opus 5.5、Luna 6
- 组件记忆
摘要组织看见转变却建在旁边。
提出 Frontier Autolab,评测多智能体组织的跨时代再创业与事后泄漏
摘要组织看见转变却建在旁边。
提出过程核验框架,审计 Agent 基准的无根据通过与奖励黑客
Scale AI 的这篇工作把 agentic benchmark 的有效性写成持续维护问题:验证器给满分,并不等于智能体展示了任务所要的能力。
提出 SkillDRE,用预执行与运行时反馈演化恶意技能
提出 CS-Guard 基准与虚构场景攻击,评测代码生成护栏
摘要论文提出了代码安全护栏基准 CS-Guard,评估发现现有护栏对虚构场景攻击和代码级恶意请求防御较弱。
提出 ColluSkill,用跨技能组合绕过 Agent 技能扫描器
摘要论文揭示了单技能孤立扫描的盲区,提出多技能链攻击 ColluSkill 与上下文防御 ChainGuard 并验证了有效性。