LADE:用暗知识中的模型无关潜在安全信号防御 LLM 越狱
提出 LADE,用首 token 暗知识在生成前过滤越狱查询
- arXiv
- 2610.07532
- 发表
- 层
- 提示层
- 场景
- 模型与 API
- 攻击者
- 白盒
- 被测模型
- Llama-2-7B-Chat、Llama-3-8B-Instruct、Qwen2-7B-Instruct 等 13 个
摘要作者用 LADE 在生成前过滤有害查询,并称八个模型中六个的 Held-out 平均最好。
LADE 是一种只读首 token 输出概率的防御,用来在生成前挡下可能引出有害回复的查询。