防御arXiv 2608.21500
SecOPD 用同策略蒸馏把自适应提示注入攻击成功率降至 9.0%
提出 SecOPD 同策略蒸馏微调,降低模型对自适应提示注入的顺从
- arXiv
- 2608.21500
- 发表
- 层
- 应用层
- 场景
- AI Agent
- 测试
- Qwen3.6-27B (Undefended)、Meta-SecAlign、SecOPD
提出 SecOPD 同策略蒸馏微调,降低模型对自适应提示注入的顺从
提出 ClawSentry 渐进式多层监控网关,拦截恶意技能包与上下文注入
ClawSentry 是挂在智能体运行时之外的安全监督网关,用来同时盖住 skill 执行的多个生命周期边界,并把已被拒绝的效果记到会话里。
提出 AGENTQ,向开源智能体权重植入仅在量化后触发的恶意工具后门
摘要论文研究了智能体量化条件后门风险,提出 AGENTQ 在保持效用的同时实现全精度隐蔽与量化后生效。
证明保留词元表示放大模板注入并验证分词缓解
摘要对话模板注入的权威性主要来自保留词元的学得向量而非文本语法,推理具有补偿作用,现有分词防御遗留工具协议漏洞。