防御arXiv 2609.36603
SED:面向 LLM 智能体的免训练持续安全策略学习框架
提出免训练框架 SED,将有害智能体轨迹蒸馏为可检索安全策略
- arXiv
- 2609.36603
- 发表
- 层
- 应用层
- 场景
- AI Agent
- 被测模型
- DeepSeek-V4-Flash、GLM-5.2、Kimi K3
提出免训练框架 SED,将有害智能体轨迹蒸馏为可检索安全策略
用后验重加权解释多模态上下文越狱,并提出风险门控的良性示例注入防御
Zhang 等把多模态 ICL 越狱写成对齐模型在安全与有害隐模式之间的推理时后验漂移,并据此做风险门控防御。