防御arXiv 2610.04470
SENTINEL:通过意图感知的输入-输出匹配防御 LLM 越狱
提出生成时防御 SENTINEL,匹配输入输出以抽出越狱意图并停写
- arXiv
- 2610.04470
- 发表
- 层
- 模型层
- 场景
- 模型与 API
- 攻击者
- 白盒
- 被测模型
- Llama2-7B、Llama3-8B、Mistral-7B-v0.2 等 6 个
提出生成时防御 SENTINEL,匹配输入输出以抽出越狱意图并停写
提出 AEGIS,用中层内部信号选择性激活后层适配器拦截音频越狱
提出 ARIA,在冻结权重上用 SAE 做推理时遗忘门控
提出 SPARK,在预填充阶段修复多模态 KV 记忆以防御视觉语言模型越狱