防御arXiv 2610.00400
DART:用表征位移检测多轮 LLM 智能体中的新兴安全风险
提出 DART,用去噪表征转移检测并干预多轮智能体攻击
- arXiv
- 2610.00400
- 发表
- 层
- 应用层
- 场景
- AI Agent
- 攻击者
- 黑盒
- 测试
- Qwen3-8B、Qwen3-14B、Qwen3-32B 等 6 个
提出 DART,用去噪表征转移检测并干预多轮智能体攻击
提出 SEAL,在 MoE 共享专家上做 DPO-LoRA 对齐以抵御越狱与权重篡改
SEAL是面向混合 MoE 的训练时防御:只对齐始终执行的共享专家,使安全不依赖路由器是否把 token 送到安全专家。
提出扩散潜空间地理扰动防御,抑制视觉语言模型泄露精确地理位置
提出 LeakGauge,用行为后缀的 prefill 对数概率检测上下文泄露
提出 SafeMol,联合对齐分子多模态模型的文本与图输入
SafeMol 研究分子多模态模型在危险分子相关请求上的安全对齐,并同时看过拒和任务效用。
提出策略条件轨迹审计器 MATE,判断移动 Agent 是否违反可编辑安全策略
MATE 是面向移动 GUI 智能体的轻量策略条件轨迹审计器,在给定自然语言安全策略时判断轨迹是否违规并解释原因。