评测与基准arXiv 2609.06966
Mole:面向前沿实验室 AI 智能体的内部威胁检测基准
提出 MOLE 基准,评测智能体内部威胁的完成情况与监控漏检
- arXiv
- 2609.06966
- 发表
- 层
- 应用层
- 场景
- 多智能体
- 测试
- Claude Opus 4.7、Claude Opus 4.8、Claude Sonnet 4.5 等 15 个
摘要MOLE 构建了智能体内部威胁检测基准,作者指出高漏检现状与推理痕迹的防御价值,并展示了监控策略优化空间。
MOLE 是首个针对前沿 AI 实验室智能体内部威胁检测的开放基准,旨在评估在有限每日审查预算与日常研发业务背景下识别恶意账号的能力。。