防御arXiv 2610.04269
SRFT:让 Agent 从失败经验中自我反思以抵御提示注入
提出 SRFT,让 Agent 从失败经验中学习拒绝提示注入
- arXiv
- 2610.04269
- 发表
- 层
- 应用层
- 场景
- AI Agent
- 被测模型
- SR-Agent-Llama、SR-Agent-Qwen3-8B、SR-Agent-Qwen3-4B
提出 SRFT,让 Agent 从失败经验中学习拒绝提示注入
提出 Provenance-Aware Transformers,隔离不可信来源防御间接提示注入
提出同策略蒸馏防御微调方法 SecOPD,抵御自适应提示注入