评测与基准arXiv 2609.19587
红队测试 Auto Mode:用注入与多上下文攻击绕过编码 Agent 阻断监控器
红队评估编码智能体的阻断监视器,并提出 Auto Mode++加固
- arXiv
- 2609.19587
- 发表
- 层
- 应用层
- 场景
- 编程 Agent
- 测试
- Opus 5、Opus 4.8、Opus 4.7 等 8 个
摘要系统评估生产阻断监视器在面对持续恶意智能体时的表现,提出加固防御并指明多上下文防御挑战。
红队评估编码智能体的阻断监视器,并提出 Auto Mode++加固
摘要系统评估生产阻断监视器在面对持续恶意智能体时的表现,提出加固防御并指明多上下文防御挑战。
构建 Emergence World,评测长时程多智能体对抗韧性与群体失效
摘要作者通过长期平行世界实验指出模型对齐不具备可组合性,单模型群体会产生社会奉承、协同退缩及语言不透明等失效。