跳到正文
原文
arXiv:越狱、提示注入、投毒与防御· arXiv:2610.07532· Wonjun Lee, Kyungsik Yang, Gaeun Ji, Vaidehi Patil, Haon Park, Bumsub Ham, Mohit Bansal, Suhyun Kim·本站收录 · 原文发表 日期未标

LADE:用暗知识中的模型无关潜在安全信号防御 LLM 越狱

Safeguarding LLMs via Model-Agnostic Latent Safety Signals from Dark Knowledge

AI 导读

LADE 通过对比有害与良性查询,从首个 token 输出概率分布的暗知识中提取潜在安全信号,构建跨模型通用的安全方向。该方法由潜在安全信号提取、Tokenizer Mapping 和 kNN 判别三部分组成,可适配不同分词器的 LLM。在多种模型和基准上,LADE 对多种越狱攻击保持稳健,降低攻击成功率并维持安全与效用的平衡。

阅读原文arxiv.org