跳到正文
原文
论文追踪· arXiv:2609.05843· Yifan Wang, Zimu Wang, Suliu Qin, Changyu Zeng, Tong Chen, Siqi Chen, Yijie Lin, Lingyu Jiang, Jionglong Su, Yushan Pan, Haiyang Zhang, Wei Wang, Qiaoyu Tan·本站收录 · 原文发表

SinoGlyphBench:中文字形混淆下语言模型审核的诊断基准

SinoGlyphBench: A Diagnostic Benchmark for Chinese Glyph-Level Obfuscation in Language-Model Moderation

论文速读

评测/基准

据论文 PDF 整理(AI 生成),以原文为准

SinoGlyphBench用匹配的字形扰动评测12个模型的中文审核,176,916次配对中四分类准确率降5.0个百分点,CondAcc为75.7%。

问题
中文字形级混淆让人仍能读懂有害内容,却使自动审核变差。现有评测常把变换类型、扰动位置和数据构成混在一起,难以判断失败来自读形、还原还是最终判定。
方法
SinoGlyphBench从STATE-ToxiCN、CNTP、PCR-ToxiCN归一到四标签,标注语义锚点,并做拆字与跨文字替换,分锚点、背景、全文三种范围,以文本或渲染图像配对评测。
实验与结果
12个LLM/MLLM共176,916次配对中,混淆使四分类准确率降5.0个百分点,有害漏报、误报升6.1和4.7个百分点,CondAcc为75.7%。全文扰动降幅最大;文本上跨文字替换更难,图像上该差距反转。
局限与可以继续做的
作者称该基准只诊断可恢复的中文字形扰动,不含多轮、截图、表情、手写、低分辨率、版式或平台约定,并继承源数据的覆盖与政策假设。模型比较还受接口、模态、提示词和厂商策略随时间变化的影响。
实验设置GPT-5.4 mini、GPT-5.5 等 · SinoGlyphBench、STATE-ToxiCN 等 · Acc、OrigAcc 等
模型
GPT-5.4 miniGPT-5.5DeepSeek V4 FlashDeepSeek V4 ProIntern-S1-ProIntern-S2 PreviewQwen3-VL-32B-InstructQwen3.6-PlusGemini 3.1 Pro PreviewGemini 3.5 FlashClaude Haiku 4.5Claude Sonnet 4.6
基准
SinoGlyphBenchSTATE-ToxiCNCNTPPCR-ToxiCN
指标
AccOrigAccObfAcc∆AccFNRH∆FNRHFPRH∆FPRHCondAcc
AI 导读全文 322 字

研究者提出 SinoGlyphBench,一个针对中文字形混淆的诊断基准,通过识别标签关键语义锚点,构造文本与图像两种模态下匹配的原始与字形混淆输入,并分别扰动锚点、背景上下文或两者,以区分审核相关证据被破坏与一般表层变化。在 12 个 LLM 与 MLLM 的 176,916 组配对评测中,字形混淆使有害内容假阴率与假阳率分别上升 6.1 和 4.7 个百分点,四分类准确率下降 5.0 个百分点,模型仅保留 75.7% 在匹配原始输入上正确的判断。全范围扰动造成的退化最大,仅扰动锚点比仅扰动背景更具破坏性,文本模态下的跨文字系统替换尤其困难。对结构化输出的分析显示,模型在可见字形读取、意图信息还原与最终安全判断之间存在可观察的不一致。

深度解读

6 个问题,约 7,500 字。每问先给一句结论,点开看完整回答

  1. 这篇论文试图解决什么问题?

    如何在保留人工可读参照的前提下,诊断中文审核对字形混淆的稳定性。

    如何构造仍可被人还原的中文字形混淆,并区分审核失败来自关键证据被扰动还是一般表面变化。

    • 场景:作者称,平台上的有害中文可用拆字、偏旁改写、跨文字同形替换等非规范字形表达,人仍能读,自动审核却更难。模型失败可能不是因为意图变了,而是书写形式不再匹配其预期表示。
    • 现有不足:作者称,更宽的混淆评测常把变换类型、扰动位置和数据构成混在一起,难以判断失败来自可见形式读取、意图还原还是最终安全判定;也不清楚失败是扰动了标签关键词,还是扰动了周围上下文。
    • 方法问题:作者问,字形混淆如何挑战模型、同时保留可用的人类参照,以及在这种受控干预下如何评估审核稳定性。Figure 1中,拆字、跨文字替换、极端拆字相对原文的BGE-M3相似度分别为0.67、0.58、0.54;作者称视觉相似度过低会削弱其作为诊断探针的价值。
    • 本文提出:SinoGlyphBench,从同一源条目构造匹配的原文与字形混淆变体,标注语义锚点(semantic anchors),并按锚点、背景或全文施加扰动,以文本和图像两种模态评测。
  2. 有哪些相关研究?

    工作分功能测试、中文有害内容基准,以及混淆、字形与多模态安全三类。

    有害内容检测与稳健性评测

    • HateCheck(Röttger et al., 2021)与Multilingual HateCheck(Röttger et al., 2022)——用功能测试隔离受控有害表达下的审核失败,覆盖仇恨言论现象与多种语言。
    • Latent Hatred(ElSherief et al., 2021)——针对隐式仇恨;Silent Signals(Kruk et al., 2024)、FETCH!(Sasse et al., 2025)、IYKYK(de Kock et al., 2026)——研究已知、新兴和极端主义编码表达。

    中文有害内容基准

    • COLD(Deng et al., 2022)——早期中文冒犯性语言基准;ToxiCN(Lu et al., 2023)——直接与间接毒性的层次分类。
    • STATE-ToxiCN(Bai et al., 2025b)——有害目标与论元的span级抽取;PCR-ToxiCN(Guo et al., 2025)——自然出现的谐音隐蔽;ChineseHarm-Bench(Liu et al., 2025)——扩大有害内容类别覆盖。
    • 作者称SinoGlyphBench建立在这些资源上,但目标是受控字形混淆,而不是隐式、编码或语音表达,并在固定底层内容的同时改变不同语义区域的可见字形。

    混淆、字形变化与多模态安全

    • ToxiCloakCN(Xiao et al., 2024)——谐音与表情隐蔽;PCR-ToxiCN与Wu et al.(2025)——语音替换或正字、语音、语义联系;CNTP(经ToxiBenchCN发布,Yang et al., 2025)——中文毒性的字形、语音和语义形式混淆。作者称这几项表明有害含义对人仍可识别、对模型更难审核,而本文用字形级设计把标签关键词上的变换与周围文本上的变换分开。
    • Glyce(Meng et al., 2019)、ChineseBERT(Sun et al., 2021)——字形特征改善汉字表示;Boucher et al.(2022)、Davis and Suignard(2025)——视觉易混或非标准字符造成人读与模型处理的差距;Wang et al.(2024a)——基于声音和形状的替换生成对抗输入。
    • MM-SafetyBench(Liu et al., 2024)、FigStep(Gong et al., 2025)——识别纯文本评测捕捉不到的多模态风险。作者称本文也评测渲染图像输入。

    基线与数据来源:本文不是与外部攻击方法比ASR,而是在SinoGlyphBench内部比较原文与混淆、以及范围和变换类型。源数据为STATE-ToxiCN、CNTP、PCR-ToxiCN。附录Table 3按设计维度对比COLD、ToxiCN、ToxiCloakCN、CNTP与本文。

    作者将本文定位为对上述混淆工作的补充:聚焦字形级、保持源内容、并分离标签关键跨度与周围上下文的扰动。

  3. 论文如何解决这个问题?

    用语义锚点控制扰动范围,配对比较拆字与跨文字替换的文本和图像输入。

    整体是诊断基准SinoGlyphBench:把源条目归一成统一标签,手工筛选可还原的字形替换,再按语义锚点控制扰动范围,并以文本或图像送入审核。

    标签、面板与锚点

    • 四标签:Hostile(针对身份或社会显著群体的攻击、蔑视、威胁、排斥、非人化或严重刻板印象);Abusive(非身份指向的侮辱、骚扰、对个人的威胁、人身攻击或攻击性脏话);Benign(描述、引用、教育、反驳及其他非有害或非攻击用法);Context-dependent(目标、立场或可还原含义不足以给出稳定有害标签)。
    • 二分类:有害集H为Hostile与Abusive;不可处置集N为Benign与Context-dependent。Context-dependent只在操作上计入N,其预测只进入二分类指标的不可处置一侧,用来测不确定时的过度拦截。
    • 两个面板:宽面板980条,字符数比≤3且可替换计数差≤2,用于覆盖性趋势;严格面板157条,比≤1.75且差为0,用于锚点与背景的更平衡比较。可替换计数差是去重前锚点与背景中目录覆盖字符位置数的绝对差。
    • 语义锚点:侮辱、威胁、目标群体、被引用的有害词,或其他对最终标签重要的表达。有源span标注时使用;最终锚点按“改变该跨度是否应影响审核相关含义的还原”选取。

    字形变换与范围

    • 两类变换:拆字(Decomposition)把汉字写成可见部件;跨文字替换(Cross-script substitution)用其他文字或Unicode区间中视觉相近的符号替换一个或多个部件。目录经人工筛选,仅当目视确认源字仍可还原时保留。作者称跨文字变体不被假定对人普遍更容易或更难。
    • 三种范围:原文保留源文本(含源数据里已有的自然变异);锚点(A)只改锚点内目录覆盖字符;背景(B)只改锚点外;全文(F)两边都改。混淆密度是被改变的源字符位置占比,作者称它是与范围绑定的强度描述,不应在未做密度调整时当作独立攻击族。
    • 实现:变体可为Unicode文本,或在模型接口支持时渲染成图像。默认字体Noto Sans,唯一字体消融换成Noto Serif。文本测非规范Unicode与混合文字;图像测视觉阅读并引入类似OCR的瓶颈。

    评测条件与指标

    • 配对:每个混淆条件c与原文条件c0固定条目、模型、提示词、模态、渲染和变换类型,只把范围设为原文。一次配对评测是同一条目上的原文输入与混淆输入。温度在接口允许时设为0。
    • 输出:附录C.2给出完整提示词。结构化字段为read_text(可见形式)、recovered_text(意图还原)、interpretation(简短审核含义)和judge(最终标签)。比较三种提示:通用、混淆感知(警告故意的非规范字形)、字形感知(另加字符级例子)。
    • 指标:四分类Acc只在输出可解析且标签属于四类时算正确,无效或缺失算错。OrigAcc、ObfAcc分别是配对原文与混淆上的准确率。∆Acc = OrigAcc − ObfAcc;∆FNRH、∆FPRH为混淆错误率减原文错误率,正值表示变差。FNRH是有害条目被标成不可处置或返回无效的比例;FPRH是不可处置条目被标成有效有害标签的比例,无效输出不计为假阳性。CondAcc是原文上正确的决策在混淆后仍正确的比例。

    失败定位与人工质检

    • 级联:先标无效输出,再把read_text与所呈现输入的参考转写比较,把recovered_text与原文中文比较,最后把judge与金标签比较。第一处可观察结果分为无效、读取错误、还原错误、判定错误或正确。忽略空白,读取与还原的编辑相似度阈值分别为0.85和0.70。作者称该级联不声称能看到模型内部推理。
    • 人工:200对偏好比较中,跨文字148、拆字20、中性或未决32;在有方向的比较中跨文字胜率88.1%,标注者间κ=0.414。572个独立扰动形式、1,144次恢复中,精确字符恢复率整体99.13%,跨文字100.00%,拆字99.08%,恢复字符一致率98.25%,且每个形式至少被一名标注者正确恢复。980条均有两次独立标签审核,调和前κ=0.333;100条子集上标签κ=0.462,字符级锚点重叠F1=0.884。
  4. 论文做了哪些实验?

    176,916次配对中混淆降低准确率并提高两类有害错误,全文扰动降幅最大。

    实验设置

    • 模型(12个):GPT-5.4 mini、GPT-5.5;DeepSeek V4 Flash、DeepSeek V4 Pro;Intern-S1-Pro、Intern-S2 Preview;Qwen3-VL-32B-Instruct、Qwen3.6-Plus;Gemini 3.1 Pro Preview、Gemini 3.5 Flash;Claude Haiku 4.5、Claude Sonnet 4.6。各模型只在其支持的模态上测试。
    • 数据:宽面板980条、严格面板157条。去重前严格面板每条可替换计数差为0;去重后锚点与背景各523条独立扰动记录,条目级最大记录差为2。宽面板在同一导出视图下有3,395条锚点记录和3,501条背景记录,最大条目级差为7。
    • 条件:模型、面板、提示设置、模态、渲染、变换类型和范围。主汇总池化全部配对评测,共176,916次;95%区间为按源条目整组重抽样的bootstrap。
    • 指标与评审:无外部评审模型。标签由模型的judge字段相对归一化金标签判定;读取/还原阈值0.85/0.70。论文未报告重复次数;解码目标是确定性,接口允许时温度为0。
    • 研究问题:RQ1混淆如何改变配对决策;RQ2范围与变换类型单独及共同的影响;RQ3评测时干预如何影响失败,以及错误出现在读取、还原还是判定。

    主结果

    Table 1池化配对评测,数值为百分数或百分点,方括号为95%条目聚类区间。

    表格较宽,可左右滑动

    分组配对数∆Acc∆FNRH∆FPRHCondAcc
    Overall176,9165.0 [4.0, 5.9]6.1 [4.9, 7.3]4.7 [3.4, 6.1]75.7 [74.0, 77.4]
    Anchor-only58,9724.4 [3.4, 5.5]4.7 [3.3, 6.0]5.1 [3.5, 6.7]77.3 [75.5, 79.1]
    Background-only58,9722.1 [1.2, 3.0]1.2 [0.0, 2.3]4.8 [3.5, 6.3]81.6 [79.9, 83.1]
    Full58,9728.5 [7.1, 9.9]12.5 [10.7, 14.3]4.3 [2.4, 6.2]68.3 [66.0, 70.4]
    Decomposition88,4584.4 [3.4, 5.3]4.5 [3.3, 5.7]5.8 [4.5, 7.2]76.8 [75.1, 78.5]
    Cross-script88,4585.6 [4.6, 6.6]7.7 [6.4, 9.0]3.7 [2.2, 5.2]74.6 [72.8, 76.4]
    • 作者称模型失去24.3%的原文正确决策(CondAcc 75.7%);全文使原文正确决策损失31.7%,FNRH升12.5个百分点。三项总体降幅的条目聚类区间下界都大于0。附录D.1的模型聚类区间和留一模型检查仍为正;作者称模型聚类区间较粗,因为只有12个模型。
    • 作者称锚点扰动比背景扰动带来更大准确率损失、更多有害漏报和更低CondAcc;两类的过度拦截增幅接近(∆FPRH 5.1与4.8个百分点),故锚点敏感性主要看有害漏报和CondAcc。
    • 作者称Figure 3在受控切片上重复同一排序,尤其在跨文字替换下。图中坐标为CondAcc(%)与∆FNRH(pp),分文本/图像及背景、锚点、全文;具体曲线端点数值论文正文未逐点列出。

    范围与模态

    Table 2为严格面板,对模型及A、B、F范围取平均;Gap为拆字减跨文字,未四舍五入前计算再保留一位。

    表格较宽,可左右滑动

    设置模型数OrigAccObfAcc拆字ObfAcc跨文字GapCondAcc拆字CondAcc跨文字Gap
    Text / Generic1265.160.054.65.483.676.27.5
    Text / Obf-aware1264.460.356.04.384.677.67.0
    Image / Generic1064.356.057.6-1.678.180.7-2.5
    Image / Obf-aware1064.857.058.6-1.679.681.7-2.1
    • 作者称文本上跨文字更难:通用提示下平均CondAcc为拆字83.6%、跨文字76.2%。图像上该差距反转:通用图像CondAcc为拆字78.1%、跨文字80.7%。图像行只有10个模型,因为只有支持视觉输入的模型产生图像结果。
    • 作者认为渲染可能保留有助于跨文字形式的形状线索,而拆字仍需从部件化视觉证据还原汉字。Table 9与附录D.4记录该总体模式及模型间差异。

    干预与失败位置

    • 提示与模态:混淆感知提示把文本平均CondAcc从83.6%提到84.6%(拆字)、从76.2%提到77.6%(跨文字);图像上对应从78.1%到79.6%、从80.7%到81.7%。作者称提升有限,未消除Table 1中的降幅。Figure 4中各点是一个匹配诊断切片,干预效应靠近0且兼有升有降;作者称混淆感知提示是所测干预里最稳定为正的,但增益相对Table 1的降幅较小。
    • 定位:Figure 5按范围和变换类型、阈值0.85/0.70汇总。作者称在所测阈值上,读取不匹配为16.7%–33.8%,还原不匹配为9.6%–14.6%,判定不匹配为26.5%–38.9%。作者称没有单一阶段能解释全部不匹配。
    • 严格面板逐模型:Table 15(图像、通用提示)与Table 16(图像、混淆感知提示)给出10个模型在A/B/F上的ObfAcc和CondAcc。以Table 15拆字全文CondAcc为例,Gemini 3.1 Pro Preview为95.3%,Claude Haiku 4.5为50.5%。DeepSeek两个模型未出现在这两张图像表中。

    其他消融与分析

    • Table 10:Intern家族内的提示词与字体消融;作者称字形感知提示和字体变化会改变成绩,但是该诊断网格内的探索,不是一般修复。
    • Table 12:同时变化读取与还原阈值,展示输出类别如何移动。
    • 人工偏好:200对中跨文字胜率(有方向比较)88.1%;字符恢复572形,精确恢复99.13%。
    • 标签审核:调和前κ=0.333(980条、各两次);100条子集标签κ=0.462,锚点F1=0.884。
    • 附录D.1:模型聚类区间与留一模型后,总体降幅仍为正。
    • 作者称图像输入和显式混淆警告都不能稳定恢复原文正确决策,不匹配可能移到另一阶段。
  5. 有什么可以进一步探索的点?

    作者称结果只针对可恢复的中文字形诊断,并计划扩展语言、政策与部署条件。

    作者指出的局限与后续方向

    • 诊断而非部署就绪:Limitations称该基准不是对部署就绪程度的穷尽评测;发现只涉及这一特定诊断能力,而不是所有真实规避策略下的审核安全。(Limitations)
    • 未纳入的表面形式:不覆盖多轮上下文、截图、表情符号、手写、低分辨率图像、版式操纵或平台特定约定。(Limitations)
    • 继承源数据:覆盖范围和政策假设来自源数据集;平台、应用场景、方言和新兴滥用策略下的审核标准可能不同,本文成绩应只作为更广安全评测的一个组成部分。(Limitations)
    • 模型比较需谨慎:结果依赖LLM/MLLM接口是否可用、模态支持、提示行为和厂商侧安全策略,这些都会随时间变化。匹配比较、尽可能确定性的解码和配对降幅指标减少了本次快照内的混淆,但没有消除接口或策略的时间变化。作者称它不提供决定性的模型排行榜。(Limitations、Conclusion)
    • 后续方向:Conclusion称未来工作可以把该框架扩展到更广的语言、政策和部署条件。
    • 发布形式:Ethical Considerations称发布时只提供源许可证允许的基准、变换代码、提示词和文档;若源文本不能不受限再分发,则发布派生元数据或构造脚本,并要求用户从官方来源获取原始数据。这是作者对发布方式的说明,不是已完成的公开状态。

    实验覆盖范围

    • 被测模型为第4问所列12个,分属GPT、DeepSeek、Intern、Qwen、Gemini、Claude六个家族;图像设置的Table 2为10个模型,Table 15和Table 16未列出两个DeepSeek模型。
    • 主结果池化176,916次配对,A/B/F各58,972次,两种变换各88,458次(Table 1);严格面板157条、宽面板980条。
    • 变换为拆字与跨文字替换;范围为原文、锚点、背景、全文;模态为文本与渲染图像;提示为通用、混淆感知,以及Intern网格中的字形感知;字体消融为Noto Sans对Noto Serif。
    • 指标含四分类Acc、FNRH、FPRH、CondAcc,以及基于0.85/0.70阈值的输出级联定位;区间为条目聚类bootstrap。论文报告了模型聚类与留一模型检查,未报告独立重复实验次数。
    • 人工质检包括200对偏好、572个形式的字符恢复,以及980条标签审核和100条子集上的锚点重叠。
  6. 总结一下论文的主要内容

    SinoGlyphBench显示中文字形混淆会同时增加有害漏报和误报,全文扰动最重。

    SinoGlyphBench是一个配对诊断基准,用来看内容审核在可还原的中文字形混淆下是否还保持原决定。

    • 问题:有害中文可写成非规范字形,人仍能读,模型却可能因为书写形式变化而改判。作者希望把“扰动了标签关键证据”和“只扰动了周围文字”分开。
    • 做法:源数据来自STATE-ToxiCN、CNTP和PCR-ToxiCN,归一为Hostile、Abusive、Benign、Context-dependent。标注语义锚点后,用拆字或跨文字替换做锚点、背景或全文扰动,再以文本或图像评测。除准确率变化外,还报告有害漏报、有害误报,以及原文正确决策的保留率CondAcc。
    • 主结果:12个LLM和MLLM、176,916次配对中,四分类准确率降5.0个百分点,FNRH升6.1个百分点,FPRH升4.7个百分点,CondAcc为75.7%(Table 1)。全文的∆Acc为8.5、∆FNRH为12.5、CondAcc为68.3;锚点的∆Acc为4.4,高于背景的2.1。
    • 条件差异:严格面板上,文本里跨文字的平均CondAcc低于拆字(通用提示76.2%对83.6%);图像里跨文字反而更高(80.7%对78.1%,Table 2)。混淆感知提示只把这些CondAcc提高约1个百分点。输出定位在多个阈值下同时出现读取、还原和判定不匹配。
    • 作者结论:被评模型对非规范字形的中文仍然不稳定;中文审核需要在整条流程中处理可见形式读取、意图还原和校准后的安全判定。作者同时称,该基准诊断的是这一受控能力,而不是部署安全性的定论。
阅读原文arxiv.org