跳到正文
事件持续更新

LADE:利用暗知识潜安全信号防御越狱

2 篇报道2 个报道来源2 小时前更新

先了解这件事

AI 综述

LADE(Latent Safety Signals for Defense)是一种解码阶段的 LLM 越狱防御方法:通过对比有害与良性查询,从参考模型首个 token 输出概率分布的暗知识中提取概率差异最大的 top-k=500 个 token,经 Tokenizer Mapping 适配不同分词器的目标模型,再用 kNN 距离在生成前判断并拦截查询。该方法不需要梯度、隐藏状态或第二个模型,信号只需从参考模型提取一次即可复用到其他模型。在 6 个开源 LLM、5 种越狱攻击及多种基准上,LADE 对多种越狱攻击保持稳健,降低攻击成功率并维持安全与效用的平衡。

AI 根据报道生成 · 37 分钟前更新

后续时间线

10月8日
  1. LADE authors精选
    LADE 提出基于首 token 暗知识的模型无关越狱防御

    LADE(Latent Safety Signals for Defense)提出一种解码阶段的越狱防御方法,从参考模型首 token 输出概率分布的暗知识中提取在有害与良性查询间概率差异最大的 top-k=500 个 token,经 tokenizer 映射后用于目标模型,再用 kNN 距离判断是否在生成前拦截查询。方法不需要梯度、隐藏状态或第二个模型,信号只需从参考模型提取一次即可复用到其他模型。在 6 个开源 LLM、5 种越狱攻击(AutoDAN、DeepInception、GCG、PAIR、LIAR)和 7 个基准上使用固定配置(Llama-3-8B-Instruct 作参考模型,k=500,K=5,不做逐模型调参),LADE 在多数模型上取得最低或接近最低的越狱合规率,例如在 Gemma-7B-it 上为 15.80,而多数对比方法在 30 以上。

10月7日
  1. arXiv:越狱、提示注入、投毒与防御
    LADE:用暗知识中的模型无关潜在安全信号防御 LLM 越狱

    LADE 通过对比有害与良性查询,从首个 token 输出概率分布的暗知识中提取潜在安全信号,构建跨模型通用的安全方向。该方法由潜在安全信号提取、Tokenizer Mapping 和 kNN 判别三部分组成,可适配不同分词器的 LLM。在多种模型和基准上,LADE 对多种越狱攻击保持稳健,降低攻击成功率并维持安全与效用的平衡。

相关讨论

本站还没有收集到这件事的讨论链接。

关注度走势

每天新增来源

2 天共 2 个·最多 1(10月7日)·今天 1

  • 10月7日 新增 1 个来源(1 家媒体、0 个账号)
  • 10月8日 新增 1 个来源(1 家媒体、0 个账号)

每小时关注度

暂无可比走势