- 防御arXiv 2605.17380
Uber 提出 ADR 企业级 Agent 检测系统,在 7200 台主机部署十个月
提出企业级检测系统 ADR,检测编程 Agent 的提示注入与恶意 MCP
- arXiv
- 2605.17380
- 发表
- 层
- 应用层
- 场景
- 编程 Agent
摘要提出了端点因果遥测、两级在线分流与离线红队闭环的 ADR 系统,并在生产环境中验证了有效性。
- 防御arXiv 2610.05163
研究者在 Claude Code 和 Codex 上构造分段提示注入并发布边界动作审计基准
提出路径对齐归因 PAA,在边界动作前审计长流程智能体的分段提示注入
- arXiv
- 2610.05163
- 发表
- 层
- 应用层
- 场景
- 编程 Agent
摘要论文针对长流程注入提出边界动作审计与 PAA,在保持低误阻的同时实现高拦截率。
本研究针对长流程智能体在执行任务时面临的分阶段间接提示注入威胁,提出了在动作生效前进行拦截的边界动作审计框架与路径对齐归因方法。
- 防御arXiv 2608.21101
ClawSentry:面向自主 LLM Agent 的渐进式多层安全监控网关
提出 ClawSentry 渐进式多层监控网关,拦截恶意技能包与上下文注入
- arXiv
- 2608.21101
- 发表
- 层
- 应用层
- 场景
- 编程 Agent
摘要ClawSentry 用包准入、三级运行时门控和反绕过,压低 skill 攻击并保住干净任务。
ClawSentry 是挂在智能体运行时之外的安全监督网关,用来同时盖住 skill 执行的多个生命周期边界,并把已被拒绝的效果记到会话里。
- 评测与基准arXiv 2609.28915
研究提出 ACE 语料库,评估内核级证据对 Agent 安全检测的有效性
构建 ACE 语料并比较内核与应用层证据的攻击检测效果
- arXiv
- 2609.28915
- 发表
- 层
- 应用层
- 场景
- 编程 Agent
摘要ACE 用配对的内核与应用层证据表明,syscall 痕迹可判别智能体攻击,两层组合通常更好。
ACE 是一份把智能体会话的内核 syscall 痕迹与应用层清单、转录配对起来的检测语料和基准。。
已经到底了