防御arXiv 2608.21500·8月22日SecOPD 用同策略蒸馏把自适应提示注入攻击成功率降至 9.0%提出 SecOPD 同策略蒸馏微调,降低模型对自适应提示注入的顺从arXiv2608.21500发表8月22日层应用层场景AI Agent测试Qwen3.6-27B (Undefended)、Meta-SecAlign、SecOPD防御模型加固攻击提示注入深度解读完整解读
攻击arXiv 2609.24994·9月22日BAM 反馈编码实现推理时隐蔽的智能体通信提出变长反馈编码 BAM,在生成文本中隐蔽传输秘密载荷arXiv2609.24994发表9月22日层模型层场景多智能体攻击者黑盒测试Llama-3.1-8B、Qwen-3.5-9B-Base、Mistral-7B-v0.3 等 6 个攻击检测规避技术编码与混淆深度解读完整解读