评测与基准arXiv 2609.19587
红队测试 Auto Mode:用注入与多上下文攻击绕过编码 Agent 阻断监控器
红队评估编码智能体的阻断监视器,并提出 Auto Mode++加固
- arXiv
- 2609.19587
- 发表
- 层
- 应用层
- 场景
- 编程 Agent
- 测试
- Opus 5、Opus 4.8、Opus 4.7 等 8 个
摘要系统评估生产阻断监视器在面对持续恶意智能体时的表现,提出加固防御并指明多上下文防御挑战。
红队评估编码智能体的阻断监视器,并提出 Auto Mode++加固
摘要系统评估生产阻断监视器在面对持续恶意智能体时的表现,提出加固防御并指明多上下文防御挑战。
构建 AGENTTELL 基准,测量浏览器智能体跨站行为侧信道泄露
摘要论文评估了浏览器智能体的行为侧信道泄露风险,并基于近万次会话提供了评测数据。
提出 RevLeakBench 测量交付物修订痕迹造成的无意泄露
修订痕迹指模型按要求删掉或换掉一项后,又在交代这次修改时把它写进给第三方的交付物。