防御arXiv 2610.04269·10月3日SRFT:让 Agent 从失败经验中自我反思以抵御提示注入提出 SRFT,让 Agent 从失败经验中学习拒绝提示注入arXiv2610.04269发表10月3日层应用层场景AI Agent被测模型SR-Agent-Llama、SR-Agent-Qwen3-8B、SR-Agent-Qwen3-4B防御模型加固攻击提示注入深度解读完整解读
防御arXiv 2608.21500·8月22日SecOPD 用同策略蒸馏把自适应提示注入攻击成功率降至 9.0%提出同策略蒸馏防御微调方法 SecOPD,抵御自适应提示注入arXiv2608.21500发表8月22日层应用层场景AI Agent被测模型SecOPD防御模型加固攻击提示注入深度解读完整解读