防御arXiv 2608.21101
ClawSentry:面向自主 LLM Agent 的渐进式多层安全监控网关
提出 ClawSentry 渐进式多层监控网关,拦截恶意技能包与上下文注入
- arXiv
- 2608.21101
- 发表
- 层
- 应用层
- 场景
- 编程 Agent
- 测试
- gemini-3.5-flash、Codex/GPT-5.4、Codex/GPT-5.5 等 7 个
摘要ClawSentry 用包准入、三级运行时门控和反绕过,压低 skill 攻击并保住干净任务。
ClawSentry 是挂在智能体运行时之外的安全监督网关,用来同时盖住 skill 执行的多个生命周期边界,并把已被拒绝的效果记到会话里。