防御arXiv 2609.19587
红队测试 Auto Mode:用注入与多上下文攻击绕过编码 Agent 阻断监控器
提出 Auto Mode ++,加固编码 Agent 阻断监视器
- arXiv
- 2609.19587
- 发表
- 层
- 应用层
- 被测模型
- Opus 5、Opus 4.8、Opus 4.7 等 8 个
摘要系统评估生产阻断监视器在面对持续恶意智能体时的表现,提出加固防御并指明多上下文防御挑战。
提出 Auto Mode ++,加固编码 Agent 阻断监视器
摘要系统评估生产阻断监视器在面对持续恶意智能体时的表现,提出加固防御并指明多上下文防御挑战。
提出 PMA,用流形对齐从 E2EO 混淆向量恢复明文
评测开发者能否在协作编程中发现编码 Agent 的隐蔽破坏
构造可通过计费审计的 token 虚报,使服务商系统性超收
不透明 LLM 的按 token 计费里,现有审计核验的是提供方可控的证据,不诚实提供方可以虚报并通过检查。。
提出企业级检测系统 ADR,识别编程 Agent 的提示注入与恶意 MCP
摘要提出了端点因果遥测、两级在线分流与离线红队闭环的 ADR 系统,并在生产环境中验证了有效性。