研究发布 ASRD 数据集,评测五款开源模型在非规范输入下的安全表现
Quad-State Safety Evaluation of Open-Weight Large Language Models on Non-Canonical Inputs
AI 导读
研究者提出 Adversarial Surface-Form Robustness Dataset(ASRD),包含七个表面形式家族的 2,100 条提示词,对五款开源权重语言模型进行评测,共产生 10,500 条回复。Quad-State Evaluation Rubric 将每条回复分为有害合规、安全回复、理解失败或无法判定四类。表情符号与不可见 Unicode 变体几乎不引发理解失败,合并有害合规率为 20.27% 和 17.20%,基线为 22.87%,主要由 Mistral 7B 拉高;而 leetspeak、编码包装和混合变换的有害合规率分别为 2.40%、0.13% 和 2.40%,理解失败率则升至 36.47%、65.60% 和 34.47%。对原始输出的检查还发现三种回复行为:幻觉式无害化、结构崩溃和语言漂移。