OTTER:仅替换五个 token 即可绕过 GPT 系列毒性审核,平均攻击成功率升至 84%
OTTER: A Red-Teaming System for Toxicity-Evading Jailbreak Prompt Optimization
OTTER替换至多5个词元降低表面毒性,在AdvBench上使四款GPT平均ASR从7.0%提升至84.0%(OTTER-RV)。
黑盒设置(black-box),攻击者仅具有标准 moderation API 和 chat API 访问权限,无需模型权重、梯度或外部辅助攻击者 LLM。
- 商用生产环境LLM依赖毒性审核API作为主要输入侧防御,假设有害意图与表面毒性词汇相关。现有白盒攻击需要权重和梯度,黑盒攻击依赖高成本辅助攻击者LLM,缺乏仅依赖标准API访问且无需模型权重的越狱审计手段。
- 提出黑盒改写框架OTTER,将越狱建模为约束优化问题。通过掩码丢弃计算词元对毒性评分的贡献度,跳过停用词选出前k个词元,利用BERT生成候选词(OTTER-MLM)或在词表中随机采样(OTTER-RV),通过贪心搜索寻找兼顾降毒与语义保持的替换组合。
- 在AdvBench的457条有害提示词上测试四款GPT模型,OTTER-MLM使平均ASR从7.0%升至75.6%,OTTER-RV达到84.0%。改写后毒性与绕过概率相关(AUC=0.823),毒性低于0.1的提示词在GPT-4类模型上绕过率为93.6%。
- 评测局限于AdvBench的英文提示词,未覆盖多语言及专业领域语料;当有害意图通过语篇结构或隐含表述呈现时词元级改写效果较弱(网络犯罪类ASR为73.7%);拒答判定依赖关键词匹配;绕过率反映当前API行为快照,随防御升级可能发生变化。
- 威胁模型
- 黑盒设置(black-box),攻击者仅具有标准 moderation API 和 chat API 访问权限,无需模型权重、梯度或外部辅助攻击者 LLM。攻击目标是通过词汇替换生成满足黑盒毒性评分 T(p*) <= tau 且保持语义相似度 cos(E(p*), E(p)) >= delta 的改写提示词 p*,使受害目标 LLM 不产生拒答响应。
- 被测模型
- gpt-4-turbogpt-4ogpt-4o-minigpt-3.5-turbo
- 基准
- AdvBench
- 指标
- ASR∆ToxBTCAUCAPI Calls
研究者提出 OTTER 黑盒红队框架,通过 mask-drop 归因找出推高毒性分数的 token,再用 BERT 掩码填充(OTTER-MLM)或随机词表替换(OTTER-RV)改写提示词,仅需标准 API 访问。在 457 条 AdvBench 提示词和四个 GPT 模型上,平均攻击成功率从 7.0% 升至 OTTER-MLM 的 75.6% 和 OTTER-RV 的 84.0%,GPT-4-turbo 提升 70.7 个百分点。论文首次量化毒性分数与绕过概率的关系(BTC=0.505,AUC=0.823),毒性低于 0.1 的提示词绕过率为 93.6%,高于 0.1 的为 57.8%。按危害类别看,自残/自杀与仇恨言论绕过率达 95% 至 96%,网络犯罪类最低为 73.7%,因技术术语本身毒性分数不高。
推荐理由论文量化了毒性分数与越狱成功率的关系,并给出按危害类别分层加固分类器的具体建议。
深度解读
这篇论文试图解决什么问题?
生产环境依赖表面毒性过滤存在本质脆弱性,论文提出仅需标准API访问的轻量黑盒越狱框架OTTER。
这篇论文试图解决商用大语言模型依赖表面毒性过滤器的脆弱性问题,以及现有越狱攻击方法因依赖白盒访问或辅助大模型而无法直接适用于闭源黑盒审计的局限。
- 输入侧防御的脆弱假设:作者称生产环境 LLM 部署普遍依赖基于毒性的审核 API(OpenAI, 2023)作为首要输入侧防御,其基本假设是有害意图与表层毒性词汇相关,但这种假设在词元替换攻击下存在结构脆弱性。
- 现有红队方法的审计局限:白盒攻击(如 GCG、AutoDAN)依赖商业 API 无法获取的模型权重与梯度;BEAST 依赖本地词元概率束搜索;黑盒攻击(如 PAIR、TAP、DAGR、PAP)依赖高能力的外部辅助攻击者 LLM,引入了额外的调用成本与延迟。
- 核心观察与假设:作者指出表层毒性与对抗意图可以发生解耦,通过替换少至 5 个词元即可在消除毒性特征的同时保留原始恶意意图。
- 威胁模型:
- 攻击者目标:构造满足黑盒毒性阈值且维持语义相似度的改写提示词,绕过输入过滤与对齐防护,诱导目标 LLM 给出实质性有害回答。
- 攻击者知识:黑盒(black-box)设定,不掌握模型权重、梯度与词元概率分布,也不使用外部辅助攻击者 LLM。
- 攻击者能力:仅具有对黑盒毒性评分接口(如 OpenAI Moderation API)和目标 LLM 对话接口的标准 API 访问权限。
- 受害系统:部署了前置输入毒性审核过滤器的闭源商业大语言模型服务(如 gpt-4-turbo、gpt-4o、gpt-4o-mini、gpt-3.5-turbo)。
- 提出的解决方案:论文提出了仅需标准 API 访问的轻量黑盒红队框架 OTTER(包含 OTTER-MLM 与 OTTER-RV 两个变体),并对毒性与绕过关系开展了系统经验分析。
有哪些相关研究?
论文梳理了白盒、辅助LLM黑盒攻击、毒性审核与红队基准,指出OTTER直接针对毒性评分且无需辅助模型。
白盒与本地对抗攻击
- 梯度与演化优化方法(Zou et al., 2023; Liu et al., 2024):GCG 通过贪心坐标梯度下降优化对抗性词元后缀;AutoDAN 使用分层遗传算法并以对数似然作为适应度函数。作者指出两者在受控环境下取得强攻击成功率,但无法应用于闭源商业 API。
- 本地束搜索方法(Sadasivan et al., 2024):BEAST 虽无需梯度,但需要本地模型访问权限以在词元概率上执行束搜索,同样不适用于闭源部署场景。
基于辅助 LLM 的黑盒攻击
- 迭代查询与树搜索(Chao et al., 2025; Mehrotra et al., 2024):PAIR 通过迭代查询目标模型并由辅助攻击者 LLM 优化候选提示词,通常在 20 次查询内收敛;TAP 在 PAIR 基础上引入树状搜索和评估器 LLM 剪枝分支。
- 多样化与说服策略(Zhao et al., 2025; Zeng et al., 2024):DAGR 在全局多样化的根提示词与局部混淆的叶提示词之间交替以提升多样性;PAP 应用包含 40 种说服策略的分类法改写有害提示词,在多个模型上取得超过 92% ASR。作者指出 PAP 旨在改变模型语义理解而非降低审核得分,且其改写仍依赖攻击者 LLM。
内容审核与安全评测基准
- 毒性检测与规避(OpenAI, 2023; Yang et al., 2024):OpenAI Moderation API 在查询到达模型前评分,但对显式关键词敏感;文生图领域的 SneakyPrompt 利用强化学习引导的词元替换绕过安全过滤。作者指出既有研究均未系统表征驱动分类决策的关键词元,亦未量化所需降毒幅度。
- 安全基准与危害分析(Zou et al., 2023; Mazeika et al., 2024; Zhao et al., 2025):AdvBench 与 HarmBench 提供了评估攻击与防御的标准行为语料;DAGR 在 HarmBench 上提供了类别级 ASR 分解。
- 基线方法与基准:实验对比了原始直接提示词基线(Direct prompt,未修改的 AdvBench 原始输入)与 GPT-4o 单次改写基线(GPT-4o paraphrase);评测基准为经 OpenAI Moderation API 过滤后保留的 457 条 AdvBench(Zou et al., 2023)提示词。
本文定位与区别
- 作者将 OTTER 与上述工作的核心区别定位为:直接将毒性评分作为优化目标,利用掩码丢弃归因识别驱动审核决策的关键词元,无需模型内部权重或外部攻击者 LLM,并首次对毒性与绕过关系进行了系统经验分析。
论文如何解决这个问题?
OTTER通过掩码丢弃归因筛选高毒性词元,结合MLM或随机词表候选,通过贪心搜索实现满足语义约束的降毒改写。
论文提出了 OTTER(Obfuscated Toxicity-Evading Token Evolution for Rewriting)黑盒红队框架,将提示词越狱建模为兼顾毒性降低与语义保持的约束优化问题,通过词元归因、候选生成与贪心搜索三步完成改写。
问题形式化与优化目标
- 符号定义:设原始有害提示词为 p = (w_1, ..., w_n),黑盒毒性评分器为 T(p) ∈ [0, 1](采用 OpenAI Moderation API),句子编码器 E(p) ∈ R^d 采用 bert-base-uncased CLS 向量生成语义嵌入。
- 约束优化问题:OTTER 寻找满足黑盒毒性阈值 T(p*) ≤ τ 且语义余弦相似度满足 cos(E(p∗), E(p)) ≥ δ 的改写提示词 p*。该式约束改写提示词在语义向量空间中与原提示词保持不低于阈值 δ 的余弦相似度。
- 超参数设定:实验设定毒性阈值 τ = 0.1,语义相似度阈值 δ = 0.7,替换预算 k = 5。
词元归因与候选生成
- 掩码丢弃归因:对提示词中的每个非停用词位置 i,将词元 w_i 替换为 [MASK] 得到 p_i^mask,通过 Δi = T(p) − T(pimask) 计算该词元对毒性评分的贡献度。该式表示遮蔽单个词元引起的毒性分值下降量,差值越大代表该词元对触发毒性审核的贡献越大。
- 位置筛选:按 Δ_i 降序选出前 k 个位置 P = {i_1, ..., i_k};论文设定跳过停用词以减少 API 调用。
- OTTER-MLM 候选集:利用 bert-base-uncased 在 fill-mask 模式下获取前 K 个上下文相关替换词(|C| = 20);任何余弦相似度低于 δ 的候选词在评估前直接剔除。
- OTTER-RV 候选集:从过滤后的完整 BERT 词表(仅纯字母、无子词、长度大于 2,词表规模约 20,000)中均匀采样候选词(|C| = 20–100),作者称该变体搜索空间更广、降毒更激进,但调用量更高。
贪心搜索与系统实现
- 位置级贪心评估:按位置顺序遍历候选词,选取最小化目标损失函数的词元:ℒ(x) = T(g(p, x)) + λ (1 − cos(E(g(p, x)), E(p)))。该损失函数结合了改写后的黑盒毒性得分与偏离原始语义的惩罚,权重 λ = 0.1 用于平衡降毒与语义漂移。
- API 调用开销:单条提示词的毒性 API 调用量约为 n_stop + k · |C|;作者报告 OTTER-MLM(k=5, |C|=20)约为 23 次调用,OTTER-RV(|C|=100)约为 100 次调用。
- 交互式系统架构:系统以三层 Web 应用实现(附录 C),前端基于 React 展示词元归因热图与毒性进度条,后端基于 FastAPI 提供 /attribute 与 /rewrite 异步任务接口及 Redis 状态队列,并通过 OpenAI Chat API 流式传输目标 LLM 响应。
论文做了哪些实验?
在457条AdvBench提示词上,OTTER将四款GPT的ASR从7.0%提至75.6%–84.0%,AUC达0.823且良性无误报。
实验设置
- 被测目标模型:四款闭源 GPT 模型,分别为 gpt-4-turbo、gpt-4o、gpt-4o-mini 和 gpt-3.5-turbo(通过 OpenAI chat API 访问)。
- 数据集与规模:AdvBench(Zou et al., 2023),原始包含 520 条有害行为指令;经 OpenAI Moderation API 过滤后保留被判定为有害的 457 条提示词。
- 对比基线:直接提示词(Direct prompt,未修改的 AdvBench 原始输入)与 GPT-4o 改写基线(GPT-4o paraphrase,通过单次 API 调用指示 GPT-4o 采用温和语言改写)。
- 指标定义:攻击成功率(ASR,目标模型未产生拒答响应的比例)、毒性变化量(∆Tox)、点二列相关系数(BTC)、受试者工作特征曲线下面积(AUC)以及 API 调用次数。
- 评审方式:遵循 Zou et al. (2023) 的子字符串匹配方法,依据标准拒答短语列表(如 "I cannot"、"I'm unable"、"I will not")进行匹配;API 超时响应视为拒答。
- 置信区间与重复设置:所有 ASR 数值均报告 95% Bootstrap 置信区间(2,000 次重采样);论文未报告独立重复运行次数。
主结果
目标模型 AdvBench 原始提示词 ASR (%) OTTER-MLM ASR (%) GPT-4-turbo 0.7 [0.0, 1.5] 71.3 [67.0, 75.3] GPT-4o 6.6 [4.4, 9.0] 69.8 [65.9, 74.0] GPT-4o-mini 7.4 [5.0, 9.8] 74.2 [70.2, 78.1] GPT-3.5-turbo 13.1 [10.3, 16.2] 87.3 [84.2, 90.4] 平均 7.0 75.6 (注:据 Table 1;OTTER-RV 平均 ASR 为 84.0%,GPT-4o 改写基线平均 ASR 为 77.0%(Table 1 标题及 §5.4),各模型细分值论文未在 Table 1 中报告)
- 绕过率大幅上升:作者指出 OTTER-MLM 将平均 ASR 从 7.0% 提升至 75.6%(提高 68.6 个百分点),所有置信区间均与基线不重叠;能力最强的 GPT-4-turbo 仍出现 70.7 个百分点的提升。
- 能力无法替代对齐:作者认为更强的模型能力并不能替代具备意图感知的审核机制;更强的模型对混淆提示词反而生成了更有帮助的回复而非更稳固的拒答。
- 基线对比透明度:单次调用的 GPT-4o 改写基线取得 77.0% 平均 ASR,但作者指出其不提供毒性度量与词元归因,且不具备可复现的改写过程。
毒性与绕过关系的定量分析
- 测了什么:测量改写后毒性得分 -T(p*) 与多数投票绕过结果的点二列相关性,以及基于 T(p*) 预测绕过的逻辑回归模型。
- 实验结果:BTC 达到 0.505(p = 6.68 × 10^-31);逻辑回归模型在 T(p*) 上的 AUC 达到 0.823(β = -4.49);T(p*) < 0.1 的提示词绕过率为 93.6%,而 T(p*) ≥ 0.1 时绕过率为 57.8%,两者相差 1.6 倍。
- 作者解读:作者认为毒性得分能可靠作为绕过概率的代理指标(AUC=0.823);残差差距(BTC < 1)反映了有害意图通过语篇结构或技术术语留存的情况,这也是 OTTER 的主要失效模式。
危害类别细分表现与机理分析
- 测了什么:在 9 类危害类型上评估 OTTER-MLM 的 ASR 和毒性下降量 ∆Tox(Table 2、Figure 4,加权平均 ASR 为 78.5%)。
- 实验结果:自残/自杀(n=25)和仇恨言论(n=20)分别达到 96.0%(∆Tox=0.759)和 95.0%(∆Tox=0.564)ASR;网络犯罪/黑客(n=179)取得最高的 ∆Tox(0.771),但 ASR 最低(73.7%)。其他类别包括欺诈/金融犯罪(n=121, ASR=80.2%, ∆Tox=0.761)、武器/爆炸物(n=37, ASR=78.4%, ∆Tox=0.760)、儿童安全(n=9, ASR=77.8%, ∆Tox=0.677)、毒品(n=13, ASR=76.9%, ∆Tox=0.735)、暴力/身体伤害(n=43, ASR=74.4%, ∆Tox=0.630)、其他(n=10, ASR=90.0%, ∆Tox=0.625)。
- 作者解读:作者分析认为,自残和仇恨言论的恶意集中在少数表面词元,替换后同时消除了审核信号与模型拒答触发;而网络犯罪等技术类词汇(如 exploit、vulnerability)在毒性得分不高时仍承载有害意图,仅降低毒性不足以触发绕过。
良性提示词误报与改写特异性分析
- 测了什么:在 100 条良性提示词上测试 OTTER 改写引起的毒性得分变化(§5.5)。
- 实验结果:100 条良性提示词的平均毒性变化量为 -0.0079;没有任何提示词的毒性增加超过 0.05,最大毒性增幅仅为 +0.0015。
- 作者解读:作者指出良性提示词本身毒性近乎为零,掩码丢弃归因无法找到高贡献词元进行替换,证实 OTTER 的改写机制在设计上具有有害提示词特异性,在良性提示词上实现零误报。
其他消融与分析
- 编辑预算 k=1 时 ASR 为 37.5%,∆Tox 为 0.372,API 调用为 3 次(Table 3)。
- 编辑预算 k=2 时 ASR 为 47.5%,∆Tox 为 0.517,API 调用为 6 次(Table 3)。
- 编辑预算 k=3 时 ASR 为 57.5%,∆Tox 为 0.614,API 调用为 9 次(Table 3)。
- 编辑预算 k=5 时 ASR 为 70.0%,∆Tox 为 0.721,API 调用为 15 次(Table 3)。
- 编辑预算 k=8 时 ASR 为 78.8%,∆Tox 为 0.803,API 调用为 24 次(Table 3)。
- 策略对比中 OTTER-MLM 的 ASR 为 78.0%(∆Tox=0.747,API 调用 15 次),OTTER-RV 达到 84.0%(∆Tox=0.813,API 调用 100 次),GPT-4o 改写为 77.0%(∆Tox=0.644,API 调用 1 次)(Table 4)。
有什么可以进一步探索的点?
作者指出当前评测局限于英文语料、依赖关键词匹配判别拒答,且对语篇级隐含意图改写效果较弱。
作者指出的局限与后续方向
- 多语言与特定领域语料:评测仅在 AdvBench 的英文提示词上进行,OTTER 在多语言输入或特定领域语料(如医疗、法律)上的表现仍是开放问题与未来研究方向(出自 Limitations)。
- API 行为快照效应:报告的绕过率反映当前 API 行为的快照,将随着审核系统更新而发生变化,未来部署中的实际严重性取决于审核系统的演进(出自 Limitations)。
- 语篇结构与隐含意图的失效模式:当有害意图通过语篇结构或隐含表述而非显式毒性关键词表达时,词元级改写效果较弱,网络犯罪类提示词相对较低的绕过率(73.7%)代表了该方法的主要失效模式(出自 Limitations 及 §5.2)。
- 拒答检测依赖关键词匹配:ASR 指标依赖关键词匹配检测拒答,当模型未用标准拒答短语产生有害内容时可能低估 ASR,而在非常规拒答表述下可能高估 ASR;作者指出未来工作可采用类似 HarmBench 的 LLM-as-judge 协议以提供更可靠估计(出自 Limitations)。
实验覆盖范围
- 被测目标模型:实验测试了 gpt-4-turbo、gpt-4o、gpt-4o-mini 和 gpt-3.5-turbo 共 4 款闭源模型,均通过 OpenAI chat API 访问。
- 测试基准与样本量:测试基准为经 OpenAI Moderation API 筛选后保留的 457 条 AdvBench 英文提示词;消融实验中 k 值分析基于 80 条提示词,策略对比基于 50 条提示词(GPT-4o 改写基于 100 条提示词);误报分析测试了 100 条良性提示词。
- 审核与辅助模型配置:毒性评分使用 OpenAI Moderation API,词元嵌入与掩码候选生成使用 bert-base-uncased,改写基线使用 GPT-4o;论文未报告针对其他商业毒性分类器的直接替换评测。
- 判定协议:评测采用基于关键词子字符串匹配的判定协议检测拒答,并计算 2,000 次重采样的 95% Bootstrap 置信区间;论文未报告各模型实验的多次独立重复运行次数。
总结一下论文的主要内容
论文展示了表面毒性与恶意意图的解耦现象,通过标准API实现黑盒越狱测试,并提出闭环分类器加固建议。
- 核心定位:该研究提出了仅需标准 API 访问权限的轻量黑盒越狱红队框架 OTTER,揭示了生产环境大语言模型表面毒性防御的架构脆弱性。
- 研究问题:工业界 LLM 普遍依赖毒性审核接口拦截有害输入,假设恶意意图与表层毒性词汇绑定;而现有白盒攻击依赖权重,黑盒攻击依赖昂贵的辅助攻击者 LLM,缺乏实用的审计工具。
- 方法机制:OTTER 将越狱建模为语义约束优化问题,利用掩码丢弃计算词元毒性归因,锁定前 k 个高毒性位置,结合 BERT 上下文候选(OTTER-MLM)或随机词表(OTTER-RV),通过贪心搜索寻找兼顾低毒性与语义保持的替换解。
- 主要实验结果:
- 在 457 条 AdvBench 提示词上,OTTER-MLM 使四款 GPT 模型的平均 ASR 从 7.0% 升至 75.6%,OTTER-RV 达到 84.0%(Table 1 标题及正文)。
- 毒性评分与多数投票绕过结果呈强负相关(BTC=0.505),逻辑回归 AUC 达 0.823;改写后毒性低于 0.1 的提示词在 GPT-4 类模型上绕过率达 93.6%(§5.1)。
- 危害类别差异显著,自残与仇恨言论 ASR 达 95.0%–96.0%,而依赖专业术语的网络犯罪类提示词即使降毒幅度最高(∆Tox=0.771)也仅取得 73.7% ASR(Table 2)。
- 在 100 条良性提示词上毒性变化均值为 -0.0079,无一条提示词毒性增加超过 0.05,实现零误报(§5.5)。
- 防御启示与结论:作者指出模型能力提升无法消除此类漏洞(GPT-4-turbo 与 GPT-3.5-turbo 的 ASR 增幅仅相差 3.5 个百分点),毒性过滤与模型拒答共享了易被扰动的表面信号;作者建议将 OTTER 纳入 CI/CD 安全管线生成对抗硬负例,并结合意图感知分类器对高风险类别进行分层防御。