防御arXiv:2608.21500 · 8月22日SecOPD 用同策略蒸馏把自适应提示注入攻击成功率降至 9.0%提出 SecOPD 同策略蒸馏微调,降低模型对自适应提示注入的顺从AI Agent·测试Qwen3.6-27B (Undefended)、Meta-SecAlign、SecOPD·应用层模型加固提示注入完整解读
防御arXiv:2608.21101 · 8月21日ClawSentry:面向自主 LLM Agent 的渐进式多层安全监控网关提出多层监控网关 ClawSentry,拦截恶意技能供应链与上下文注入编程 Agent·测试Codex/GPT-5.4、Codex/GPT-5.5、Claude Code/GLM-5.1 等 7 个·应用层权限与审批投毒与后门MCP 与技能+3+3摘要ClawSentry 用包准入、三级运行时门控和反绕过,压低 skill 攻击并保住干净任务。ClawSentry 是挂在智能体运行时之外的安全监督网关,用来同时盖住 skill 执行的多个生命周期边界,并把已被拒绝的效果记到会话里。完整解读
防御arXiv:2609.35932 · 9月28日同字节不同权限:保留 token 表示如何放大聊天模板提示注入证明保留词元表示放大模板注入并验证分词缓解AI Agent·测试Qwen3-8B、Qwen3-32B、Llama-3.1-8B-Instruct 等 6 个·应用层指令与数据隔离提示注入摘要对话模板注入的权威性主要来自保留词元的学得向量而非文本语法,推理具有补偿作用,现有分词防御遗留工具协议漏洞。完整解读