SENTINEL:通过意图感知的输入-输出匹配防御 LLM 越狱
Reactivating Alignment: Defending LLMs from Jailbreaks via Intention-Aware Input-Output Matching
AI 导读
研究者提出生成时越狱防御方法 SENTINEL,将防御重构为意图提取问题,利用指令微调 LLM 的输入-输出语义一致性,匹配语义对齐区域以提取暴露意图的子序列,并用拒答方向投影打分、必要时中止生成。在 HarmBench 上对多个 LLM 的实验中,SENTINEL 将越狱成功率降至接近 5%,同时保持较低的过度拒答,并对自适应攻击表现出鲁棒性。