- 防御arXiv 2605.17380
Uber 提出 ADR 企业级 Agent 检测系统,在 7200 台主机部署十个月
提出企业级检测系统 ADR,检测编程 Agent 的提示注入与恶意 MCP
- arXiv
- 2605.17380
- 发表
- 层
- 应用层
- 场景
- 编程 Agent
摘要提出了端点因果遥测、两级在线分流与离线红队闭环的 ADR 系统,并在生产环境中验证了有效性。
- 攻击arXiv 2609.27542
研究者用控制 token 注入删除 gpt-oss-20b 推理链并绕过思维链监控
提出控制标记注入,清空工具智能体推理链以绕过思维链监控
- arXiv
- 2609.27542
- 发表
- 层
- 应用层
- 场景
- AI Agent
摘要论文阐明控制标记注入可抑制 CoT 使监控失效并促成拒绝绕过,且工具执行受解析器宽容度影响。
- 防御arXiv 2609.19587
红队测试 Auto Mode:用注入与多上下文攻击绕过编码 Agent 阻断监控器
提出 Auto Mode ++,加固编码 Agent 的阻断监视器
- arXiv
- 2609.19587
- 发表
- 层
- 应用层
- 场景
- 编程 Agent
摘要系统评估生产阻断监视器在面对持续恶意智能体时的表现,提出加固防御并指明多上下文防御挑战。
- 攻击arXiv 2609.06749
PMA 攻击:针对隐私保护 LLM 中嵌入到嵌入混淆的语义流形对齐方法
提出 PMA,用流形对齐从 E2EO 混淆向量恢复明文
- arXiv
- 2609.06749
- 发表
- 层
- 模型层
- 场景
- 模型与 API
已经到底了