防御arXiv 2610.00400
DART:用表征位移检测多轮 LLM 智能体中的新兴安全风险
提出 DART,用去噪表征转移检测并干预多轮智能体攻击
- arXiv
- 2610.00400
- 发表
- 层
- 应用层
- 场景
- AI Agent
- 攻击者
- 黑盒
- 测试
- Qwen3-8B、Qwen3-14B、Qwen3-32B 等 6 个
提出 DART,用去噪表征转移检测并干预多轮智能体攻击
提出 SPARK,在预填充阶段修复多模态 KV 记忆以防御视觉语言模型越狱
提出 REINS,在 SAE 空间抑制有害延续并增强拒答
REINS 是一种推理时 SAE 安全转向方法,并配有用于上下文伪装的基准 GUISE。
提出 AEGIS,用中层内部信号选择性激活后层适配器拦截音频越狱
提出 Constitutional adapters,蒸馏宪法行为以缓解越狱与失准
摘要差分宪法适配器在长上下文和多轮上更稳,并可按 α 换取遵从。