评测与基准arXiv 2610.03153
EvoRiskBench:面向工作区 Agent 运行时安全风险的演化基准
提出 EvoRiskBench,评测工作区智能体的运行时安全风险
- arXiv
- 2610.03153
- 发表
- 层
- 应用层
- 测试
- DeepSeek-V4-Pro-0813、GPT-5.6 Sol、Claude Opus 5
摘要论文构建了工作空间智能体运行时风险基准 EvoRiskBench,发现高执行力智能体在 IPI 下面临较高安全风险。
提出 EvoRiskBench,评测工作区智能体的运行时安全风险
摘要论文构建了工作空间智能体运行时风险基准 EvoRiskBench,发现高执行力智能体在 IPI 下面临较高安全风险。
测量多智能体委托结构下有害任务拒答的失效
摘要论文揭示多智能体层级委托会导致单模型安全对齐失效,多项前沿模型有害执行大幅增加且单层防御难以奏效。