跳到正文
原文
LADE authors·本站收录 · 原文发表 日期未标精选关注度59

LADE 提出基于首 token 暗知识的模型无关越狱防御

LADE: Latent Safety Signals for Defense — project

AI 导读

LADE(Latent Safety Signals for Defense)提出一种解码阶段的越狱防御方法,从参考模型首 token 输出概率分布的暗知识中提取在有害与良性查询间概率差异最大的 top-k=500 个 token,经 tokenizer 映射后用于目标模型,再用 kNN 距离判断是否在生成前拦截查询。方法不需要梯度、隐藏状态或第二个模型,信号只需从参考模型提取一次即可复用到其他模型。在 6 个开源 LLM、5 种越狱攻击(AutoDAN、DeepInception、GCG、PAIR、LIAR)和 7 个基准上使用固定配置(Llama-3-8B-Instruct 作参考模型,k=500,K=5,不做逐模型调参),LADE 在多数模型上取得最低或接近最低的越狱合规率,例如在 Gemma-7B-it 上为 15.80,而多数对比方法在 30 以上。

推荐理由

LADE 只用首 token 输出概率分布做解码阶段防御,无需隐藏状态或第二个模型,并给出跨模型迁移与过度拒答的对比数据。

相关论文
阅读原文wonjuun.github.io