研究:内容不变的风格包装可翻转 LLM 安全评判器的判定
研究用保持内容不变的样式包装测试8种安全评审器,发现GPT-4o-mini在特定包装下有害漏报率达19.9%而审查模型表现分化。
- 19.9%GPT-4o-mini通用提示词下token拒绝包装危害隐匿翻转率
- 12.3%Llama Guard 4在教育框架包装下的危害隐匿翻转率
- 100.0%Keyword规则评审器在伪合规包装下的虚构危害翻转率
论文探究自动安全评审器是否会因与内容无关的样式修饰改变判定,导致安全评测与防御评估失真。
论文关联了大模型评审器偏置与不一致性、输入端框架敏感性、越狱评测有效性及审查模型防线等工作。
论文通过构建内容不变样式包装器,并在控制回复主体逐字节一致的条件下建立包含噪声底线的翻转率评测协议。
论文在600条基准回复上评估了8种评审器在9种包装下的翻转率,发现特定模型存在漏洞且提示词可抑制翻转。
作者指出了包装器数量表征、中小模型评审器局限、基准标签噪声及单轮截断等不足,后续方向包括前沿模型与多轮轨迹评估。
论文揭示特定安全评审器易受保持内容不变的外层包装诱导改变判定,并指出安全评估应将判定稳定性作为重要考量指标。