防御arXiv 2610.04269
SRFT:让 Agent 从失败经验中自我反思以抵御提示注入
提出 SRFT,让 Agent 从失败经验中学习拒绝提示注入
- arXiv
- 2610.04269
- 发表
- 层
- 应用层
- 场景
- AI Agent
- 被测模型
- SR-Agent-Llama、SR-Agent-Qwen3-8B、SR-Agent-Qwen3-4B
提出 SRFT,让 Agent 从失败经验中学习拒绝提示注入
提出 Provenance-Aware Transformers,隔离不可信来源防御间接提示注入
诊断 BatchNorm 架构下机器遗忘评测的归一化伪影
BN illusion 是作者对近似机器遗忘评测中一种 BatchNorm 测量伪影的命名:不改权重、只用 retain 数据重算运行统计,就可以把表面遗忘准确率翻过来。
提出同策略蒸馏防御微调方法 SecOPD,抵御自适应提示注入