LADE:利用暗知识潜安全信号防御越狱
先了解这件事
LADE(Latent Safety Signals for Defense)是一种解码阶段的 LLM 越狱防御方法:通过对比有害与良性查询,从参考模型首个 token 输出概率分布的暗知识中提取概率差异最大的 top-k=500 个 token,经 Tokenizer Mapping 适配不同分词器的目标模型,再用 kNN 距离在生成前判断并拦截查询。该方法不需要梯度、隐藏状态或第二个模型,信号只需从参考模型提取一次即可复用到其他模型。在 6 个开源 LLM、5 种越狱攻击及多种基准上,LADE 对多种越狱攻击保持稳健,降低攻击成功率并维持安全与效用的平衡。
AI 根据报道生成 · 37 分钟前更新
后续时间线
- LADE authors精选LADE 提出基于首 token 暗知识的模型无关越狱防御
LADE(Latent Safety Signals for Defense)提出一种解码阶段的越狱防御方法,从参考模型首 token 输出概率分布的暗知识中提取在有害与良性查询间概率差异最大的 top-k=500 个 token,经 tokenizer 映射后用于目标模型,再用 kNN 距离判断是否在生成前拦截查询。方法不需要梯度、隐藏状态或第二个模型,信号只需从参考模型提取一次即可复用到其他模型。在 6 个开源 LLM、5 种越狱攻击(AutoDAN、DeepInception、GCG、PAIR、LIAR)和 7 个基准上使用固定配置(Llama-3-8B-Instruct 作参考模型,k=500,K=5,不做逐模型调参),LADE 在多数模型上取得最低或接近最低的越狱合规率,例如在 Gemma-7B-it 上为 15.80,而多数对比方法在 30 以上。
- arXiv:越狱、提示注入、投毒与防御LADE:用暗知识中的模型无关潜在安全信号防御 LLM 越狱
LADE 通过对比有害与良性查询,从首个 token 输出概率分布的暗知识中提取潜在安全信号,构建跨模型通用的安全方向。该方法由潜在安全信号提取、Tokenizer Mapping 和 kNN 判别三部分组成,可适配不同分词器的 LLM。在多种模型和基准上,LADE 对多种越狱攻击保持稳健,降低攻击成功率并维持安全与效用的平衡。
相关讨论
关注度走势
每天新增来源
- 10月7日 新增 1 个来源(1 家媒体、0 个账号)
- 10月8日 新增 1 个来源(1 家媒体、0 个账号)