防御arXiv:2608.21500 · 8月22日SecOPD 用同策略蒸馏把自适应提示注入攻击成功率降至 9.0%提出 SecOPD 同策略蒸馏微调,降低模型对自适应提示注入的顺从AI Agent·测试Qwen3.6-27B (Undefended)、Meta-SecAlign、SecOPD·应用层模型加固提示注入完整解读
防御arXiv:2609.35932 · 9月28日同字节不同权限:保留 token 表示如何放大聊天模板提示注入证明保留词元表示放大模板注入并验证分词缓解AI Agent·测试Qwen3-8B、Qwen3-32B、Llama-3.1-8B-Instruct 等 6 个·应用层指令与数据隔离提示注入摘要对话模板注入的权威性主要来自保留词元的学得向量而非文本语法,推理具有补偿作用,现有分词防御遗留工具协议漏洞。完整解读