防御arXiv:2608.21500 · 8月22日SecOPD 用同策略蒸馏把自适应提示注入攻击成功率降至 9.0%提出 SecOPD 同策略蒸馏微调,降低模型对自适应提示注入的顺从AI Agent·测试Qwen3.6-27B (Undefended)、Meta-SecAlign、SecOPD·应用层模型加固提示注入完整解读
防御arXiv:2609.07529 · 9月7日CoER:用对抗协同演化与精炼防御自适应间接提示注入提出 CoER,用对抗共进化与精炼训练智能体抵御自适应间接提示注入AI Agent·测试Qwen3.5-9B、MAGIC (Qwen2.5-7B)、Lifelong Defender i2 RR 等 9 个·应用层模型加固提示注入完整解读