- 防御arXiv 2608.21101
ClawSentry:面向自主 LLM Agent 的渐进式多层安全监控网关
提出 ClawSentry 渐进式多层监控网关,拦截恶意技能包与上下文注入
- arXiv
- 2608.21101
- 发表
- 层
- 应用层
- 场景
- 编程 Agent
摘要ClawSentry 用包准入、三级运行时门控和反绕过,压低 skill 攻击并保住干净任务。
ClawSentry 是挂在智能体运行时之外的安全监督网关,用来同时盖住 skill 执行的多个生命周期边界,并把已被拒绝的效果记到会话里。
- 评测与基准arXiv 2609.28915
研究提出 ACE 语料库,评估内核级证据对 Agent 安全检测的有效性
构建 ACE 语料并比较内核与应用层证据的攻击检测效果
- arXiv
- 2609.28915
- 发表
- 层
- 应用层
- 场景
- 编程 Agent
摘要ACE 用配对的内核与应用层证据表明,syscall 痕迹可判别智能体攻击,两层组合通常更好。
ACE 是一份把智能体会话的内核 syscall 痕迹与应用层清单、转录配对起来的检测语料和基准。。
已经到底了