评测与基准arXiv 2609.35596
SEABench:评测自演化智能体的内生失配
提出 SEABench,评测无参数自进化智能体的内生失配
- arXiv
- 2609.35596
- 发表
- 层
- 应用层
- 场景
- AI Agent
- 测试
- Kimi K2.5、Grok 4.3、GPT 5.6 Luna 等 4 个
摘要SEABench 显示无参数自进化能提高任务完成,同时在配对未进化基线安全的下游任务上引入可归因的安全失败。
SEABench 是一个面向个人助理、参数不更新的自进化智能体基准,用来测量局部适应如何变成后续任务上的内生失配。。