LADE 提出基于首 token 暗知识的模型无关越狱防御
LADE(Latent Safety Signals for Defense)提出一种解码阶段的越狱防御方法,从参考模型首 token 输出概率分布的暗知识中提取在有害与良性查询间概率差异最大的 top-k=500 个 token,经 tokenizer 映射后用于目标模型,再用 kNN 距离判断是否在生成前拦截查询。方法不需要梯度、隐藏状态或第二个模型,信号只需从参考模型提取一次即可复用到其他模型。在 6 个开源 LLM、5 种越狱攻击(AutoDAN、DeepInception、GCG、PAIR、LIAR)和 7 个基准上使用固定配置(Llama-3-8B-Instruct 作参考模型,k=500,K=5,不做逐模型调参),LADE 在多数模型上取得最低或接近最低的越狱合规率,例如在 Gemma-7B-it 上为 15.80,而多数对比方法在 30 以上。
推荐理由LADE 只用首 token 输出概率分布做解码阶段防御,无需隐藏状态或第二个模型,并给出跨模型迁移与过度拒答的对比数据。