防御arXiv 2608.21500·8月22日SecOPD 用同策略蒸馏把自适应提示注入攻击成功率降至 9.0%提出 SecOPD 同策略蒸馏微调,降低模型对自适应提示注入的顺从arXiv2608.21500发表8月22日层应用层场景AI Agent测试Meta-SecAlign、Qwen3.6-27B (Undefended)、SecOPD防御模型加固攻击提示注入深度解读完整解读
防御arXiv 2609.07529·9月7日CoER:用对抗协同演化与精炼防御自适应间接提示注入提出 CoER,用对抗共进化与精炼训练智能体抵御自适应间接提示注入arXiv2609.07529发表9月7日层应用层场景AI Agent测试Meta-SecAlign-8B、Qwen3.5-9B、MAGIC (Qwen2.5-7B) 等 9 个防御模型加固攻击提示注入深度解读完整解读