跳到正文
原文
arXiv:越狱与提示注入· arXiv:2609.08236· Yongxi Zhou·· 24 天前精选关注度78

研究:内容不变的风格包装可翻转 LLM 安全评判器的判定

Style Over Substance: Content-Invariant Wrappers Flip LLM Safety-Judge Verdicts

AI 导读

研究者提出内容不变的风格包装攻击,在回复正文逐字节不变的前提下,只在前后添加固定字符串改变语气,测试 8 个安全评判器是否会翻转判定。在 600 条来自 JailbreakBench 的回复(300 条有害、300 条拒答,覆盖四个目标模型)上,token 式拒答包装把 GPT-4o-mini 正确判为不安全的判定翻转 19.9%(95% CI [15.0, 24.0],噪声下限 0.5%),而 Claude 仅 0.4%。已部署的 Llama Guard 4 同样被绕过,教育课程框架翻转其 12.3% 的有害判定,token 式拒答翻转 8.3%;另一个专用护栏 gpt-oss-safeguard-20b 对所有包装的翻转均不超过 1.2%,低于其自身噪声下限。仅修改评判提示词、要求忽略语气后,同一模型上的 token 式拒答攻击约减少十倍。

论文速读

问题
自动安全评判器(如 Llama Guard、GPT-4o 评分提示)产出几乎所有越狱成功率、防御评估和安全排行榜的数字,但人们一直把评判器当作固定 oracle。作者要问:这些评判器评的是回复的实际内容,还是它的语气?
方法
保持回复内容逐字节不变,只在前后加固定字符串的 content-invariant style wrappers(如教育免责声明、伦理反思、假推理块、先拒答再照旧输出有害内容、说教结尾,以及让无害拒答听起来危险的框架),覆盖 600 条回复、8 个评判器,用配对显著性检验、置信区间和实测 noise floor 衡量 flip 率。
实验与结果
多数评判器几乎不动,但特定评判器有特定盲点:token-refusal wrapper 把 GPT-4o-mini 19.9% 的正确 unsafe 判为 safe,而 Claude 仅 0.4%;Llama Guard 4 被教育课程框架翻转 12.3%、token refusal 翻转 8.3%;一句前置语可翻转关键词评判器 100% 的拒答判定;gpt-oss-safeguard-20b 无 wrapper 超过 1.2%。仅改评分提示(StrongREJECT 风格)可把 token-refusal 攻击降低约十倍。评判器之间对哪个目标模型最安全也不一致(全体一致率 55.5%),该 artifact 集上的四模型安全排名对采样本身就不稳定。
局限与可以继续做的
九个 wrapper 只是对该集合的刻画而非总体估计;最大效应来自明显对抗性的 wrapper,细微的 harm-hiding wrapper 未通过 Holm 校正,仅作提示性报告。评分评判器用的是各厂商小/中档模型而非前沿模型,ShieldGemma、WildGuard 等开放 guard 留待后续。基准 unsafe 率压缩,排行榜重排被视为未确认的不稳定性轴。gold label 来自 JailbreakBench 分类器而非人工,人工验证测得约 8% 噪声。assertion-adding 层的“style”标签可争议。约 60% 回复在生成长度上限处截断。仅研究单轮文本回复。

据 论文全文(AI 生成) 整理,供快速了解,以论文原文为准。

推荐理由

论文用内容不变的风格包装测试 8 个安全评判器,量化了各评判器被翻转的比率,做安全评测的团队可据此检查自己的评分环节。

阅读原文arxiv.org