防御arXiv 2608.21500·8月22日SecOPD 用同策略蒸馏把自适应提示注入攻击成功率降至 9.0%提出 SecOPD 同策略蒸馏微调,降低模型对自适应提示注入的顺从arXiv2608.21500发表8月22日层应用层场景AI Agent测试Qwen3.6-27B (Undefended)、Meta-SecAlign、SecOPD防御模型加固攻击提示注入深度解读完整解读
防御arXiv 2609.07529·9月7日CoER:用对抗协同演化与精炼防御自适应间接提示注入提出 CoER,用对抗共进化与精炼训练智能体抵御自适应间接提示注入arXiv2609.07529发表9月7日层应用层场景AI Agent测试Qwen3.5-9B、MAGIC (Qwen2.5-7B)、Lifelong Defender i2 RR 等 9 个防御模型加固攻击提示注入深度解读完整解读