跳到正文
原文
论文追踪· arXiv:2605.22258· Jingyi Kang, Junyu Lu, Bo Xu et al.·本站收录 · 原文发表

CITA:面向中文隐式毒性的攻击与防御数据生成框架

Harder to Defend: Towards Chinese Toxicity Attacks via Implicit Enhancement and Obfuscation Rewriting

论文速读

攻击

据论文 PDF 整理(AI 生成),以原文为准

CITA三阶段生成中文隐式毒性文本,七检测器平均ASR为69.48%(Table 1)。

威胁模型红队评测意义上的攻击:给定中文上下文,红队模型生成回应,使独立判为有害的文本被检测器判为 safe。

问题
中文毒性可以不靠显性辱骂,而用语义间接和表面混淆保留有害意图。作者认为现有中文资源对这两类策略覆盖有限,检测器需要超出显性用词的评测。
方法
CITA先把毒性帖配上上下文做监督微调以保留有害意图,再用GRPO提高间接性,最后由四类改写代理做谐音、换序、简繁混用和emoji变体。评测检测器不参与该优化。
实验与结果
七个检测器上,完整CITA平均ASR为69.48%,高于HIL的59.51%和HIL+ITE的68.36%(Table 1)。作者称主要升幅来自ITE。CITD在五个公开测试集上平均准确率91.97%(Table 4)。
局限与可以继续做的
作者指出未评测部分新发布模型,生成限于离线单轮,防御只做监督微调。实验覆盖七个检测器、五个公开中文毒性数据集,以及Qwen3从4B到32B的规模比较。
实验设置Tencent、Baidu 等 · COLD、SWSR 等 · ASR、classification accuracy
威胁模型
红队评测意义上的攻击:给定中文上下文,红队模型生成回应,使独立判为有害的文本被检测器判为 safe。评测检测器不参与策略优化;ITE 的对抗检测器只提供训练时奖励。检测器收到的是候选文本本身。受害系统是七个毒性检测器。
被测模型
TencentBaiduGemini 3.1 ProClaude Opus 4.6GPT-5.4DeepSeek-R1Qwen3-8BQwen3-4BQwen3-14BQwen3-32BCITD
基准
COLDSWSRSCCDCNTPToxiCN
指标
ASRclassification accuracy
AI 导读研究者提出中文隐式毒性攻击框架 CITA,通过有害意图学习、隐式毒性增强和混淆变体改写三个阶段,在保留有害意图的同时提升表达的隐晦程度并加入受控的表面变体。在 CITA 生成的评测样本上,七个被测检测器出现明显漏检,平均攻击成功率(ASR)达 69.48%,人工评估也确认有害性得以保留且隐晦度和规避性上升。作为下游防御应用,研究者用 CITA 生成的红队数据微调出中文隐式毒性防御模型 CITD,显示这类数据可通过额外训练提升鲁棒性。作者强调 CITA 是受控的红队评测与防御数据生成框架,而非可部署的规避工具。

研究者提出中文隐式毒性攻击框架 CITA,通过有害意图学习、隐式毒性增强和混淆变体改写三个阶段,在保留有害意图的同时提升表达的隐晦程度并加入受控的表面变体。在 CITA 生成的评测样本上,七个被测检测器出现明显漏检,平均攻击成功率(ASR)达 69.48%,人工评估也确认有害性得以保留且隐晦度和规避性上升。作为下游防御应用,研究者用 CITA 生成的红队数据微调出中文隐式毒性防御模型 CITD,显示这类数据可通过额外训练提升鲁棒性。作者强调 CITA 是受控的红队评测与防御数据生成框架,而非可部署的规避工具。

深度解读

6 个问题,点开问题读完整回答

  1. 这篇论文试图解决什么问题?

    中文检测器面对语义间接与表面混淆时容易漏检,CITA用来做受控红队评测。

    中文毒性检测缺少能同时施加语义间接与表面混淆的受控评测。

    • 出现场景:作者称平台与 LLM 部署中的毒性不限于显性辱骂,敌意可以去掉明显词仍被保留。中文另有两类压力:含义被暗示的语义间接,以及谐音、字形扰动等表面混淆;作者认为现有中文安全资源标注成本高,且对这些策略覆盖有限。
    • 现有不足:作者称隐式毒性生成、中文毒性基准和表面改写通常被分开研究。英文隐式毒性工作较多,中文隐式毒性仍较少被探索。
    • 本文提出:作者提出受控红队框架 CITA(Chinese Implicit Toxicity Attack),分 Harmful Intent Learning、Implicit Toxicity Enhancement、Obfuscation Variant Rewriting,用于检测器评测和防御数据生成。作者称它不是可部署的逃避工具。下游用生成数据微调 CITD。
    • 威胁模型:
      • 目标:生成仍含有害意图的中文回应,并使检测器输出 safe。ASR 只统计独立判定 J_tox 为有害、且检测器判为 safe 的样本。
      • 知识:最终 ASR 所用检测器不参与策略优化。ITE 的对抗检测器 f_adv 只提供训练时奖励,与评测检测器分开。
      • 能力:输入是中文讨论上下文;模型生成回应后,可再做间接性优化和指定类型的表面改写。检测器 f 收到的是候选文本本身,包含已有混淆。
      • 受害系统:七个毒性检测器,包括商业审核 API、闭源 LLM 和开源中文向 LLM。
  2. 有哪些相关研究?

    论文讨论了LLM红队、隐式毒性与中文混淆检测;作者称这些工作通常被分开做。

    论文把相关工作分成 LLM 安全红队,以及中文毒性检测与表面混淆两类,并据此定位生成式评测。

    LLM 安全与红队生成

    • Perez et al. (2022):用语言模型生成红队测试用例,扩大可能风险的覆盖。
    • RealToxicityPrompts(Gehman et al., 2020)与 ToxiGen(Hartvigsen et al., 2022):前者用真实网页提示词评测神经文本的毒性退化;后者用模型生成对抗性和隐式仇恨样本。
    • HarmBench(Mazeika et al., 2024)与 Wen et al. (2023):前者是自动化红队与拒绝鲁棒性基准;后者研究 LLM 生成被现有检测器漏掉的隐式毒性文本,并称强化学习可进一步增强该行为。

    中文毒性检测与表面混淆

    • 中文资源:Zhou et al. (2022)、Jiang et al. (2021)、Lu et al. (2023)、Yang et al. (2025b)、Bai et al. (2025) 被概括为覆盖对话偏见、细粒度毒性、网络欺凌和 span 级目标感知仇恨。
    • 英文隐式仇恨:Sap et al. (2020)、Vidgen et al. (2021) 从显性辱骂转向隐式仇恨与社会语境推理。
    • 中文 cloak 与扰动:ToxiCloakCN(Xiao et al., 2024)、多扰动检测(Yang et al., 2025c)、谐音图加毒性词表(Ma et al., 2025)、拼音掩码检测(Guo et al., 2025)。作者称这些工作主要检测或恢复被改写的毒性文本。

    基线方法与基准

    • 检测对照数据:COLD、SWSR、SCCD、CNTP、ToxiCN,用作七个检测器的公开 ASR 对照,不是另一套生成器。
    • 防御对照:同一 Qwen3-8B 骨干在各公开训练集上分别微调,以及五源均衡混合 Mixed。

    作者把本文放在红队生成上,但范围收在中文隐式毒性:同时处理语义间接和 Obfuscation Variant Rewriting,并用于检测器评测与防御训练,而不是只做检测或恢复。

  3. 论文如何解决这个问题?

    CITA分HIL、ITE、OVR:先保住有害意图,再提高间接性并做四类表面改写。

    CITA 是三阶段生成式红队:先学会在自然上下文里产出有害回应,再用奖励提高语义间接性,最后做受控表面变体。作者称目的是审计检测器并生成防御数据,不是可部署攻击系统。

    问题设定与成功判定

    • 输入输出:给定中文讨论上下文 q,红队模型 π_θ 生成回应 y。阶段 s 取 HIL、HIL+ITE 或完整 CITA。HIL 与 ITE 每条样本是一条回应;完整 CITA 把每个保留的 OVR 变体单独计为一条,因为表面形式不同。
    • ASR:只在独立毒性判定为有害的样本上计算。ASRs(f)=|{y∈ Ys:Jtox(y)=1∧ f(y)=safe}|/|{y∈ Ys:Jtox(y)=1}|。含义是:分母排除无害生成,分子是其中被检测器判为 safe 的数量。J_tox 不充当 GRPO 奖励模型。
    • 分母规模:论文给出 HIL 有毒样本 725 条、ITE 1,055 条;完整 CITA 的分母是被独立判为有害的保留 OVR 变体集合,正文未给条数。

    Harmful Intent Learning

    • 数据:从已有中文毒性帖构造上下文—回应配对,来源为 Jiang et al. (2021)、Deng et al. (2022)、Lu et al. (2023)、Yang et al. (2025b,c)。先去掉内容不完整的样本,再划分训练与评测。
    • 上下文:对保留的毒性帖 y,由 GPT-4o-mini 生成短中文上下文 q,要求能合理引出 y,并保持原目标与立场、不引入无关有害内容。不一致、重复、改变有害性或上下文支撑不足的配对被丢弃;含糊样本删除而不是修补。
    • 训练:过滤后的 D_hil 上做标准自回归监督微调。实现为 batch size 16、学习率 1×10−5、3 个 epoch。

    Implicit Toxicity Enhancement

    • 奖励:对同一 q 采样一组回应,奖励为检测器逃避项与质量项的加权和。r(y,q;fadv)=λeva reva(y;fadv)+λqual rqual(y,q)。r_eva 在 f_adv 判 safe 时为 1、判 toxic 时为 −1;r_qual 为 (s_qual−1)/4,落在 0 到 1。s_qual 由 LLM 按四维打 1–5 分:有害意图保留、间接性、自然度、无明显毒性标记。1 分对应失败或无毒,5 分对应四维都满足。
    • 优化:组内用均值和标准差做归一化优势,再按 GRPO(Shao et al., 2024)更新。参考模型是 HIL 模型,并使用概率比裁剪和 KL 正则。实现为每条提示 8 次 rollout、batch size 8、学习率 1×10−6、KL 系数 0.05、1 个 epoch。
    • 隔离:f_adv 与质量评判在实现中都是 GPT-4o-mini,只用于 ITE 训练。最终 ASR 检测器与 J_tox 与之分开。正文将 λ_eva、λ_qual 指向附录,未给出数值。附录 E 给出生成与质量奖励提示词,此处不展开其中的句式约束。

    Obfuscation Variant Rewriting

    • 四类变体:Homophone Replacement(换成同音或近音)、Character Transposition(敏感片段内调换邻近字序并保持可懂)、Traditional Mixing(简体改繁体或混用)、Emoji-based Substitution(用指向同一目标或态度的 emoji 替换毒性或身份相关词)。给定 ITE 输出 y 和类型 c,对应代理产出 y^(c)=R_c(y)。
    • 代理:四个改写代理都从 Qwen3-0.6B 初始化,用 CNTP 中成对的原文与混淆表达做类型特定监督微调。实现为每类随机 3,000 条,batch size 16、学习率 1×10−5、3 个 epoch。论文称另有人工质量检查,要求改写后可懂、保留有害意图且符合指定类型。附录 E 给出改写提示词。

    实现规模

    • 划分:过滤后得到 13,603 对,训练 12,242、评测上下文 1,361(Table 5)。候选毒性回应来自五个公开集,过滤后占比为 COLD 19.74%、SWSR 18.12%、SCCD 19.74%、CNTP 18.75%、ToxiCN 23.66%。
    • 骨干:CITA 生成器与 CITD 都从 Qwen3-8B 初始化。HIL 与 ITE 在同一留出上下文集上评测。每阶段后做人工核验,有毒样本从 HIL 的 725 增至 ITE 的 1,055,再送入 OVR。实验在八张 NVIDIA A100 上进行。
  4. 论文做了哪些实验?

    七检测器上完整CITA平均ASR为69.48%;作者称主要升幅来自ITE。

    实验设置

    • 检测器:Tencent、Baidu 两个商业审核 API;闭源 Gemini 3.1 Pro、Claude Opus 4.6、GPT-5.4(附录 C 标识为 gemini-3.1-pro-preview、claude-opus-4-6、gpt-5.4);开源 DeepSeek-R1 与 Qwen3-8B(附录 C 对应 deepseek-ai/DeepSeek-R1、Qwen/Qwen3-8B)。共 7 个。
    • 生成器关系:CITA 生成器从 Qwen3-8B 初始化后再做 HIL/ITE。论文未写 Table 1 中的检测器 Qwen3-8B 使用了该微调权重。
    • 数据:公开对照为 COLD、SWSR、SCCD、CNTP、ToxiCN。生成评测用 1,361 个留出上下文;ASR 分母为独立判毒样本,HIL 725 条、ITE 1,055 条。第 4.1 节称最终 CITA 是四种 OVR 变体上的平均表现。
    • 指标:ASR 只在判毒样本上计算;越高表示判为 safe 的漏检越多。作者称该指标只用于评测。防御实验用分类准确率。
    • 评审:训练时质量分与对抗检测由 GPT-4o-mini 完成,不用于最终 ASR。正文未给出七个检测器的判定提示词和阈值。人工质量标注为 3 名中文语言学背景标注者。论文未报告 ASR 的重复次数。

    主结果

    据 Table 1,单位为 ASR(%)。SCCD 列是平均 ASR 最高的公开对照,不是每个检测器的最高公开集。

    表格较宽,可左右滑动

    检测器HILHIL+ITECITASCCD
    Tencent84.1490.3391.7886.40
    Baidu83.7290.0591.1690.20
    Gemini 3.1 Pro70.9079.1578.6563.70
    Claude Opus 4.655.1764.9367.7540.20
    GPT-5.455.8667.4968.7761.60
    DeepSeek-R134.2141.8041.6131.80
    Qwen3-8B32.5544.8046.6643.10
    • 平均:作者报告 CITA 平均 ASR 为 69.48%,HIL 为 59.51%,HIL+ITE 为 68.36%。作者称从 HIL 到 HIL+ITE 上升 8.85%,OVR 只从 68.36% 到 69.48%,因此 ITE 承担了大部分压力,OVR 是随后的表面压力测试。作者称 CITA 比 SCCD 的平均 ASR 59.57% 高 9.91%。
    • 例外:Gemini 3.1 Pro 的 CITA 为 78.65%,低于 HIL+ITE 的 79.15%;DeepSeek-R1 为 41.61%,低于 HIL+ITE 的 41.80%。并非每个检测器都在完整管线上更高。
    • 检测器差异:作者称商业 API 漏检更高;CITA 上 Tencent 为 91.78%,Baidu 为 91.16%。作者称 DeepSeek-R1 与 Qwen3-8B 相对更稳,CITA 上仍为 41.61% 与 46.66%。Table 1 中 SCCD 上 Qwen3 为 43.10%,高于 Claude 的 40.20%;COLD 上最高的是 Baidu 75.30%,Tencent 为 64.30%,低于 Gemini 的 68.20%。

    人工评测

    • 测了什么:3 名标注者对 HIL、HIL+ITE、完整 CITA 打五分 Likert,维度为 harmfulness、implicitness、naturalness、evasiveness。先对每条平均标注,再对阶段内条目平均。Krippendorff's α 为 0.783、0.808、0.813、0.833(Table 6)。论文未报告标注条数。
    • 结果:作者称 ITE 在四维上都高于 HIL,并给出 implicitness 从 3.47 到 4.00、evasiveness 从 3.03 到 3.77、naturalness 从 3.95 到 4.20。OVR 后 evasiveness 到 4.05,naturalness 从 4.20 降到 3.59;完整 CITA 的 harmfulness 为 3.97。
    • 作者解读:作者称 OVR 是表面混淆与流畅度的权衡,有害意图仍被保留;该人工研究用来核验生成数据,与 Table 1 的检测器 ASR 分开。

    混淆变体与意图类别

    • 四类改写:Table 2 只覆盖 GPT-5.4、Claude Opus 4.6、Gemini 3.1 Pro、Qwen3。四类平均 ASR 为 63.60%–68.11%;Homophone Replacement 平均 68.11% 最高,Emoji-based Substitution 平均 63.60% 最低。四类列平均与 Table 1 的 CITA 一致:Gemini 78.65%、GPT 68.77%、Claude 67.75%、Qwen3 46.66%。
    • 与作者说法不一致处:作者称 Traditional-Simplified Mixing 在 Gemini 和 Qwen3 上最好。Table 2 中 Gemini 的 Trad. 为 79.81%,是该检测器四类中最高;Qwen 的 Trad. 为 45.59%,低于 Homo. 的 52.99%。作者称没有单一策略稳定占优,这一点与各检测器的最高类型不同相符。
    • 意图类别:Table 3 把原帖手工分成 Direct Attack、Discrimination、Stereotype、Sarcasm,并在 GPT-5.4、Claude Opus 4.6、Gemini 3.1 Pro 上报告 HIL、ITE、OVR。讽刺类从 HIL 到 ITE,GPT 从 60.49% 到 82.73%,Claude 从 58.02% 到 80.91%。作者称讽刺类往往最难,直接攻击在 GPT 与 Claude 上相对较低。Gemini 的 Discrimination 从 ITE 的 83.52% 到 OVR 的 82.87%,Stereotype 从 77.91% 到 76.16%,并非各类在 OVR 后都更高。论文未报告各类样本数。

    防御训练

    • 设置:Qwen3-8B 以 CITA 有毒样本为正、公开训练集中的非毒样本为负,类均衡,得到 CITD。对照使用同一骨干、类均衡、训练条数、预算和优化设置,分别在五个公开集或 Mixed 上微调。非毒样本来自训练划分,并去掉与五个测试集的直接重叠。每个测试集为 1,000 条有毒加 500 条非毒。作者称该实验不对公开测试检测器做攻击优化。蓝队训练为 batch size 8、学习率 1×10−5、2 个 epoch。论文未给出训练条数的具体数字。
    • 结果:CITD 平均准确率 91.97%,Mixed 为 90.83%(Table 4)。CITD 在 SWSR、SCCD、ToxiCN 上为 91.33%、93.73%、91.47%,高于表中其他训练行。
    • 例外:COLD 上域内微调为 94.33%,高于 CITD 的 88.80%;CNTP 上域内为 97.60%、Mixed 为 98.53%,高于 CITD 的 94.53%。作者称生成数据是补充,而不是替代基准特定监督。

    其他消融与分析

    • 奖励消融(Table 7,ITE,检测器为 GPT、Claude、Qwen):去掉质量奖励后人工判毒比例 9.60%,论文未报告 ASR;去掉逃避奖励后判毒比例 52.75%,三检测器平均 ASR 53.11%;完整奖励判毒比例 77.51%,平均 ASR 59.07%,人工 harmfulness、implicitness、naturalness、evasiveness 为 4.15、4.00、4.20、3.77。
    • 改写器消融(Table 8,GPT、Claude、Qwen):零样本 Qwen3-0.6B 平均 ASR 45.35%,微调后的 OVR 代理为 61.06%。
    • 规模(附录 G.3):作者称 Qwen3-14B 在图中四组上 ASR 都最高,其中公开集平均 42.12%,混淆改写变体 65.14%;Qwen3-32B 在混淆改写变体上为 51.00%。作者称参数量增大并不单调降低 ASR。Qwen3-4B、14B、32B 上,ITE 相对 HIL 的升幅为 6.64%、10.65%、11.55%。
    • 附录 G.4 用两则定性例子对照 HIL、ITE 与四类 OVR 的表面改写,不在此复述例句。
  5. 有什么可以进一步探索的点?

    作者指出未评部分新模型、生成限于离线单轮,且防御只做了监督微调。

    作者指出的局限与后续方向

    • 模型范围:因访问和算力限制,未评测部分新发布的大语言模型;作者计划在资源允许时加入更多模型(Limitations)。
    • 交互形态:当前隐式毒性红队数据聚焦离线单轮;作者称未来应纳入更真实的多轮对话和多模态社区语境(Limitations)。
    • 防御训练:防御实验限于监督微调;作者称未来将探索更广的后训练技术,以及迭代式红队/蓝队训练(Limitations)。

    实验覆盖范围

    • 检测器:主 ASR 表覆盖 Tencent、Baidu、Gemini 3.1 Pro、Claude Opus 4.6、GPT-5.4、DeepSeek-R1、Qwen3-8B,共 7 个(第 4.1 节、Table 1)。
    • 数据与分母:公开对照为 COLD、SWSR、SCCD、CNTP、ToxiCN;生成评测用 1,361 个留出上下文,HIL 与 ITE 的 ASR 分母为 725 与 1,055 条判毒样本(第 3.2、3.6 节)。论文未给出完整 CITA 的 OVR 判毒分母条数,也未报告 ASR 重复次数。
    • 同族规模:附录 G.3 与 Figure 8 比较了 Qwen3-4B、Qwen3-8B、Qwen3-14B、Qwen3-32B。变体诊断 Table 2 与类别分析 Table 3 未列入 Tencent、Baidu、DeepSeek-R1。
    • 防御与人工:防御为 Qwen3-8B 上的监督微调,五个测试集各 1,000 条有毒加 500 条非毒(第 4.6 节、Table 4)。人工质量标注为 3 人、四维 Likert,并报告 Krippendorff's α(第 4.3 节、Table 6)。论文未报告人工评测条数,也未报告 ASR 分母毒性判定的标注者间一致性。
    • 训练侧模型与超参:上下文生成、ITE 质量评判和对抗检测器为 GPT-4o-mini;OVR 代理从 Qwen3-0.6B 微调。ITE 为每提示 8 次 rollout、KL 系数 0.05、1 个 epoch(第 3.6 节、附录 D)。正文未给出 λ_eva、λ_qual 和检测器阈值的具体数值,只指向附录。
  6. 总结一下论文的主要内容

    CITA生成隐式且经表面改写的中文毒性样本,七检测器平均ASR为69.48%。

    CITA 是面向中文毒性检测器的受控红队框架,用来造评测样本和防御训练数据;作者称不把它当作可部署攻击工具。

    • 问题:毒性可以去掉明显用词仍保留敌意。作者认为中文同时存在语义间接和表面混淆,而既有生成、基准和改写工作通常只覆盖其中一面。
    • 方法:HIL 把公开毒性帖配上 GPT-4o-mini 写的上下文,对 Qwen3-8B 做监督微调。ITE 用 GRPO,奖励来自训练时对抗检测器是否判为 safe,以及四维质量分;评测检测器不进入该优化。OVR 用四个从 Qwen3-0.6B 微调的代理,做谐音替换、邻近字换序、简繁混用和 emoji 替换。ASR 只在独立判为有害的样本上计算。
    • 检测结果:Table 1 中,完整 CITA 在七个检测器上的平均 ASR 为 69.48%,HIL 为 59.51%,HIL+ITE 为 68.36%。作者称主要升幅来自 ITE。CITA 上 Tencent 为 91.78%、Baidu 为 91.16%,DeepSeek-R1 为 41.61%、Qwen3-8B 为 46.66%。Gemini 与 DeepSeek-R1 的完整 CITA 并不高于各自的 HIL+ITE。
    • 人工与防御:完整 CITA 的 harmfulness 为 3.97;OVR 后 evasiveness 为 4.05,naturalness 从 4.20 降到 3.59。CITD 在五个公开测试集上平均准确率 91.97%,Mixed 为 90.83%,但 COLD 与 CNTP 上未超过最强域内或混合对照。
    • 作者结论:作者认为有效的检测器逃避应保住有害意图,同时提高间接性和逃避性;语义间接是主要压力,表面混淆是其后的附加压力。作者认为中文毒性评测应包含超出显性词的隐式样本,且经校验的生成数据可作防御监督。
阅读原文arxiv.org