跳到正文
原文
arXiv:越狱与提示注入· arXiv:2609.05850· Quoc Viet Vo·· 27 天前

SAFEGuard:通过有害语义分析与流畅度测量检测优化型越狱攻击

SAFEGuard: Detect Optimization-Based Jailbreak Attacks Through Harmful Semantic Analysis and Fluency Measurement

AI 导读

研究者提出统一检测框架 SAFEGuard,用于检测基于优化的越狱攻击。该方法结合基于跨层分布距离与困惑度的混合流畅度测量,以及通过梯度匹配进行的有害语义分析。其依据的观察是:高流畅度提示仍保留与有害提示接近的恶意意图,而有害语义混淆的提示往往注入无意义 token 序列。评估显示 SAFEGuard 在不同优化型越狱上持续优于现有基线,准确率有显著提升。该论文发表于 EMNLP 2026。

阅读原文arxiv.org