跳到正文
原文
arXiv:越狱、提示注入、投毒与防御· arXiv:2610.04470· Luoyu Chen, Weiqi Wang, Chenhan Zhang, Zhiyi Tian, Shui Yu·本站收录 · 原文发表 日期未标

SENTINEL:通过意图感知的输入-输出匹配防御 LLM 越狱

Reactivating Alignment: Defending LLMs from Jailbreaks via Intention-Aware Input-Output Matching

AI 导读

研究者提出生成时越狱防御方法 SENTINEL,将防御重构为意图提取问题,利用指令微调 LLM 的输入-输出语义一致性,匹配语义对齐区域以提取暴露意图的子序列,并用拒答方向投影打分、必要时中止生成。在 HarmBench 上对多个 LLM 的实验中,SENTINEL 将越狱成功率降至接近 5%,同时保持较低的过度拒答,并对自适应攻击表现出鲁棒性。

阅读原文arxiv.org