防御arXiv 2609.36603
SED:面向 LLM 智能体的免训练持续安全策略学习框架
提出免训练框架 SED,将有害智能体轨迹蒸馏为可检索安全策略
- arXiv
- 2609.36603
- 发表
- 层
- 应用层
- 场景
- AI Agent
- 被测模型
- DeepSeek-V4-Flash、GLM-5.2、Kimi K3
提出免训练框架 SED,将有害智能体轨迹蒸馏为可检索安全策略
提出 SPARK,在预填充阶段修复多模态 KV 记忆以防御视觉语言模型越狱
系统梳理智能体执行链路中的越狱攻击与防御并比较推理时防御
Mia 等人把越狱安全从单轮回复扩展到智能体的规划、记忆、工具和智能体间通信,并问既有结论在更强原生对齐下是否还成立。
提出 CFD 跨会话分解攻击,利用工件来源缺口绕过工具型 Agent 的本地检查
CFD针对工具型 LLM 智能体:利用 artifact 来源不被跟踪这一部署失败模式,把有害目标拆开后延迟组合。