跳到正文
原文
arXiv:越狱、提示注入、投毒与防御· arXiv:2610.04467· Luoyu Chen, Weiqi Wang, Chenhan Zhang, Zhiyi Tian, Yuxian Huang, Shui Yu·本站收录 · 原文发表 日期未标

无需目标答案的潜在空间安全对齐:无监督对抗训练提升 LLM 越狱鲁棒性

Target-free Latent Safety Alignment

AI 导读

针对现有对抗训练依赖固定有害目标或固定良性—有害数据对做定向激活消融、导致对抗样本行为单一的问题,研究者提出无目标对抗训练框架 Target-free Latent Safety Alignment,以无监督方式放大并多样化模型潜在空间中的行为级偏移,生成语义多样的对抗样本。该方法用语义熵作为输出层面的对抗行为多样性度量,在目标模型上诱发出多种有害行为,缓解行为窄化并提升对越狱攻击的鲁棒性。

阅读原文arxiv.org