跳到正文
原文
论文追踪· arXiv:2606.09700· Qin Yang, Lu Malloy, Joshua Lee et al.·本站收录 · 原文发表 精选关注度59

研究者提出 HPAA 攻击:用排版视觉线索绕过 13 个内容审核系统

What the Eyes See, the LLMs Miss: Exploiting Human Perception for Adversarial Text Attacks

论文速读

攻击

据论文 PDF 整理(Gemini 生成),以原文为准

该研究针对13个审核系统提出利用排版视觉线索的HPAA攻击,单次尝试使检测率降至17%以下。

威胁模型黑盒设置,攻击者为普通非特权用户,无法访问审核系统的架构、参数、训练数据或内部决策逻辑,仅能观察审核输出(安全/不安全判定及置信度),无法修改平台策略;攻击者通过在良性文本中嵌入排版变换的有害短语实施规避。

问题
现代LLM内容审核系统基于文本分词处理,难以捕捉人类依赖的空间排版、间隔与视觉强调等视觉线索,使得人类一眼可识别的有害内容能够规避自动化审核。
方法
提出HPAA框架,解耦人类感知与黑盒规避:先通过两轮用户研究(N=370)筛选高人类可识破率的排版配置子集,再在黑盒设置下以有限查询预算(1或3次)将有害表达嵌入良性载体文本并测试审核系统。
实验与结果
在包含13个审核系统的评测中,针对最高人类可识别率配置(92%),单次尝试下检测率普遍降至接近0%(均低于17%);在3次尝试预算下规避率最高达到100%,显著高于传统对抗攻击基线。
局限与可以继续做的
作者指出参与者预先知晓有害内容可能带来启动效应,且评估仅逼近实际部署;实验覆盖了13个现代内容审核系统及4个传统模型,数据集基于STTD(249条有害文本)和5个领域的良性评论,针对5个有害类别展开。
实验设置Llama-Guard-3-8B、Perspective API 等 · AdvBench (STTD)、BTD (TripAdvisor, Yelp, IMDb, Amazon Product, Amazon Music) 等 · Detection Rate、Evasion Rate 等
被测模型
Llama-Guard-3-8BPerspective APIShieldGemma-2BShieldGemma-9BGemini 2.0 FlashGemini 2.5 Flash-LiteAzure AI Content Safety APIAmazon Comprehend Toxicity DetectionAmazon Nova Lite 2.0ChatGPT-3.5GPT-4oOmni-Moderation-LatestEnkrypt AI Guardrails API
基准
AdvBench (STTD)BTD (TripAdvisor, Yelp, IMDb, Amazon Product, Amazon Music)HUS-IHUS-IIHED
指标
Detection RateEvasion Ratek-shot Evasion RateHuman Recognition Rate (Participant-Reported, Experimenter-Verified)Normalized Selection Rate
AI 导读和推荐理由研究者提出 Human-Perceptible Adversarial Attacks(HPAA),通过间距、强调和空间排列等排版手段把有害内容嵌入良性文本,使人类仍能识别而自动审核系统难以检测。该攻击在黑盒、小查询预算下运行,无需模型内部信息或梯度。在多个数据集和 13 个已部署审核系统(含商业 API 与开源护栏)上,仅用 3 次检测器查询,生成样本的人类识别率超过 86%,而各系统检测率低于 1%。1-shot 设置下最强配置达到 83.33% 规避率、92% 人类识别率;3-shot 预算下最高达 100% 规避率。研究还分析了驱动规避的排版因素、现有审核架构失效原因,并讨论了防御方向。

研究者提出 Human-Perceptible Adversarial Attacks(HPAA),通过间距、强调和空间排列等排版手段把有害内容嵌入良性文本,使人类仍能识别而自动审核系统难以检测。该攻击在黑盒、小查询预算下运行,无需模型内部信息或梯度。在多个数据集和 13 个已部署审核系统(含商业 API 与开源护栏)上,仅用 3 次检测器查询,生成样本的人类识别率超过 86%,而各系统检测率低于 1%。1-shot 设置下最强配置达到 83.33% 规避率、92% 人类识别率;3-shot 预算下最高达 100% 规避率。研究还分析了驱动规避的排版因素、现有审核架构失效原因,并讨论了防御方向。

推荐理由论文提出利用排版视觉线索绕过内容审核的 HPAA 攻击,在 13 个审核系统上给出可复现的规避率与人类识别率对比。

深度解读

6 个问题,点开问题读完整回答

  1. 这篇论文试图解决什么问题?

    大模型审核系统依赖文本分词而忽略视觉线索,导致人类可辨识的有害内容能够规避检测。

    现代基于大语言模型(LLM)的内容审核系统在分词输入上存在视觉排版盲区,导致人类易于辨识的有害内容能够规避自动化审查。

    • 问题场景与现实危害:在线平台普遍采用分级审核流水线,依赖自动化检测器对海量用户生成内容进行初筛;由于机器通常基于纯文本分词进行处理,忽略了视觉线索,导致自动化审核存在被绕过的风险。
    • 现有方法的不足:现有对抗文本攻击多侧重于诱导模型误分类而追求人类不可见,或通过改写改变表面形式,往往以牺牲语义可读性为代价,未能系统利用视觉排版机制构建端到端规避信道。
    • 论文的核心观察:人类理解文本时不仅依赖词汇语义,还会借助空格、强调和空间排列等视觉排版线索;攻击者无需同时欺骗人类与机器,只需绕过自动化模型并将有害信息传递给人类用户。
    • 论文提出的方法:提出了人类可感知对抗攻击(HPAA),通过结合排版粒度、布局策略与样式变换,在黑盒及低查询预算下将有害内容嵌入良性文本。
    • 威胁模型:
      • 目标:生成能被人类读者识别为有害、但被自动化系统判定为良性的样本,从而绕过过滤触达最终用户。
      • 知识:黑盒设定,攻击者无法访问审核系统的模型架构、参数、训练数据或内部决策逻辑。
      • 能力:攻击者仅通过常规普通用户账号提交内容,只能观察安全/不安全判定及置信度输出,无法干预平台规则或部署。
      • 受害系统:现代在线平台的内容审核流水线(包括文本提交接口与基于LLM或传统分类器的毒性检测机制)。
  2. 有哪些相关研究?

    既有攻击侧重模型混淆且多损害可读性,鲜有将人类视觉感知与排版嵌入作为规避信道。

    现有研究主要围绕模型中心的对抗文本攻击展开,而将人类感知与排版线索结合的研究较为少见。

    • 对抗文本攻击:
      • 字符与词级扰动:Ebrahimi 等(2018)、Jin 等(2020)、Li 等(2018)等研究了字符插入、删除、交换、同形替换以及词级替换;作者指出这类扰动通常以不可感知或模型混淆为导向,往往导致语义清晰度下降。
      • 改写与越狱攻击:Iyyer 等(2018)、Zou 等(2023)等探索了句法控制改写与越狱攻击;作者指出这些方法主要在模型行为层面评估,较少系统探讨排版样式与空间布局作为对抗信道。
      • 文本隐写技术:Ahvanooey 等(2018)、Wu 等(2024)等研究了将隐藏信息嵌入良性文本的隐写方案;作者称其未系统性利用排版视觉线索来规避AI审查。
    • 以人为中心的对抗探索:
      • 人类感知评估:Dyrmishi 等(2023)评估了人类对词级对抗样本的感知;Das 等(2024)、Deng 等(2023)提出了人类可读的情境提示与越狱;作者指出这些工作很少将人类受试者引入攻击设计闭环,也未系统连接人类感知度与模型检测率。
    • 基线方法与基准:
      • 对比基线:DeepWordBug、TextBugger、TextFooler(Homoglyph 变体)。
      • 评测基准:AdvBench(抽取短有害文本 STTD)、5 个真实评论数据集构成的良性载体文本集(BTD)。
    • 与既有工作的定位区别:作者称,HPAA 是首个将用户研究同时整合到攻击构建与评估中的对抗框架,揭示了人类感知与机器分词检测之间的系统性脱节。
  3. 论文如何解决这个问题?

    采用两阶段框架:离线用户研究精炼高感知排版配置,在线黑盒以极低预算迭代规避。

    通过两阶段框架将人类感知评估与在线审核规避解耦,利用排版组合在良性文本中嵌入有害表达。

    形式化与配置空间

    攻击目标形式化为:给定有害输入文本 t 与良性载体文本 b,利用排版嵌入过程 x = F(t, b; h) 生成样本 x,使得自动化分类器判定为安全,同时人类读者能够识别出有害内容。排版配置空间定义为 H = {M, L, S}:

    • 排版粒度(L):包含词级(Word,保持单词完整)、Token级(Token,拆分长度4以上的单词为至少2字符的子词)和混合级(Mixed,结合子词与单字符切分)。
    • 放置策略(M):包含左侧垂直对齐(M1)、居中垂直对齐(M2)、右侧垂直对齐(M3)、主对角线对齐(M4)、反对角线对齐(M5)和全文本随机分布(M6)。
    • 样式变换(S):包含加粗(B)、颜色(Col)、高亮(Hi)、带圈字符转换(Pre)、大小写翻转(Cap)和填空掩码(Cloze)。全因子空间共包含 108 种配置。

    第一阶段:人类引导的排版配置精炼

    为避免每次攻击都调用人类评估的高昂成本,通过两轮用户研究离线筛选高人类可感知度的配置子集:

    • Round I(配置初筛):通过两两对比实验评估 108 种配置的人类可识别性,筛选出归一化得分不低于 0.80 的 Top-21 候选集 H1。
    • Round II(定向评估):在真实跨领域文本上评估 H1,测量实验人员验证的人类识别率,保留识别率达到 80% 及以上的 10 种配置构成精炼集合 H2。
    • 平台约束过滤:根据目标平台支持的原生排版特性过滤生成可部署配置集 H'。

    第二阶段:在线黑盒攻击生成

    • 攻击迭代流程:在黑盒交互下,按照精炼配置集的排序依次选取配置生成样本并提交审核系统。
    • 终止与更新条件:若收到良性判定则攻击成功并终止;若判定为不安全,则在查询预算 k(如 1 或 3 次)内尝试下一个配置,直至成功或预算耗尽。
  4. 论文做了哪些实验?

    在13个系统中,单次尝试使检测率降至17%以下,3次预算规避率达100%。

    在 13 个主流审核系统和 5 种有害类别上评测,证明 HPAA 能在保持高人类识别率的同时大幅降低检测率。

    实验设置

    • 被测系统:共 13 个(Table 10),涵盖开源守卫与商业模型:Llama-Guard-3-8B(LG3-8B)、Perspective API(PA)、ShieldGemma-2B(SG-2B)、ShieldGemma-9B(SG-9B)、Gemini 2.0 Flash(G2F)、Gemini 2.5 Flash-Lite(G-2.5-FL)、Azure AI Content Safety(Azure)、Amazon Comprehend Toxicity Detection(Amazon-C)、Amazon Nova Lite 2.0(Amazon-N)、ChatGPT-3.5(GPT-3.5)、GPT-4o、Omni-Moderation-Latest(Omni)、Enkrypt AI Guardrails API。
    • 评测数据集:短毒性文本集 STTD(从 AdvBench 重新标注的 249 条不超过 10 个词的有害样本,覆盖 Hate、Violent、Sexual、Self-harm、Insults 五类);良性文本集 BTD(来自 TripAdvisor、Yelp、IMDb、Amazon Product、Amazon Music 的五星好评);HPAA 评测集 HED。
    • 基线方法:DeepWordBug、TextBugger、TextFooler(Homoglyph)。
    • 指标与评审方式:检测率(判定为 Unsafe 的比例)、规避率(检测率的补数)、k-shot 规避率;连续分数的模型(Azure、PA)使用默认阈值 0.5。
    • 人类受试样本:Round I 共 120 人(跨设备测试,每组合至少展示 5 次),Round II 共 250 人(5 个领域各 50 人)。

    主结果

    在 1-shot 攻击(采用 H2 中人类识别率达 92% 的 M6-W-Hi 配置)下,各模型在原始毒性文本(Original)与攻击后文本(HPAA)的检测率对比如下(据 Table 2):

    表格较宽,可左右滑动

    模型Hate (Orig / HPAA)Violent (Orig / HPAA)Sexual (Orig / HPAA)Self-harm (Orig / HPAA)Insults (Orig / HPAA)
    SG-9B54.41% / 0.00%53.51% / 0.00%66.67% / 0.00%75.00% / 0.00%44.93% / 0.00%
    PA77.94% / 1.52%71.05% / 0.89%94.44% / 5.88%79.55% / 2.33%61.59% / 1.52%
    Amazon-C94.12% / 1.47%94.74% / 0.00%97.22% / 2.78%93.18% / 4.55%78.26% / 3.62%
    Enkrypt AI80.88% / 0.00%72.81% / 0.00%97.22% / 0.00%84.09% / 0.00%65.22% / 0.00%
    Azure AI86.76% / 11.76%82.46% / 14.04%86.11% / 16.67%88.64% / 13.64%60.87% / 11.59%
    LG3-8B91.18% / 0.00%89.47% / 0.00%88.89% / 0.00%97.73% / 0.00%74.64% / 0.00%
    G2F100.00% / 1.47%89.47% / 0.00%91.67% / 0.00%100.00% / 0.00%75.36% / 0.72%
    GPT-4o98.53% / 4.41%94.74% / 2.63%97.22% / 2.78%100.00% / 2.27%89.13% / 2.90%
    G-2.5-FL100.00% / 11.76%98.25% / 7.89%97.22% / 8.33%100.00% / 6.82%92.03% / 10.14%
    Omni95.59% / 2.94%92.98% / 1.75%97.22% / 2.78%90.91% / 0.00%77.54% / 1.45%
    • 攻击下降幅度:作者称 HPAA 将检测率降低了一到两个数量级,多个模型在部分类别上的检测率降至 0.00%。
    • 最强鲁棒模型表现:Azure AI 和 G-2.5-FL 相对较强,但攻击后检测率仍低于 17%(Azure 最高 16.67%,G-2.5-FL 最高 11.76%)。
    • 综合规避率:跨所有系统与类别,单次攻击规避率最高达到 83.33%,对应 92% 的人类识别率。

    3-Shot 攻击预算评测

    • 测了什么:在 3 次迭代预算(k=3)下评测规避率,分为包含高亮的完整集合 H2(Figure 5a)与不包含高亮的受限集合(Figure 5b)。
    • 结果:在完整集合下,绝大多数系统(如 G2F、SG-2B、SG-9B、LG3-8B、Amazon-N 等)规避率达到 100%,整体达到 100% 规避率且最低人类识别率为 86%;在受限集合下,规避率最高达到 100%(最低人类识别率为 84%),Azure 规避率从初始的 17% 升至 99.6%,GPT-4o 规避率达到 100%。
    • 作者解读:后续攻击尝试即使只针对前序失败样本,仍能带来提升,表明不同排版配置利用了互补的审核弱点。

    对抗基线对比评测

    • 测了什么:对比传统基于 TextAttack 的扰动方法在相同模型上的规避率(Table 5)。
    • 结果:DeepWordBug、TextBugger 和 TextFooler 在被测系统上的规避率普遍较低(例如在 G-2.5-FL 上为 5.2%–7.6%,在 GPT-4o 上为 7.6%–10.0%,最高在 SG-2B 上为 62.3%–62.6%)。
    • 作者解读:传统基于词汇扰动的攻击在现代审核系统前成功率有限,而 HPAA 规避率明显更高。

    其他消融与分析

    • 良性词比例敏感度:保留 10% 良性词时样本在 t-SNE 中与有害簇重叠,保留 90% 时样本向良性簇靠拢(Figure 7)。
    • 样式变换的作用:仅交叉插入良性词在 PA 上规避率约为 70%,加入 M6-W-Hi 排版后升至 99%(第 5.4.3 节)。
    • 有害文本长度扩展:在 5 到 20 词的 AdvBench 文本中,PA 与 Azure 的规避率均在 91.9% 至 100.0% 之间(Table 3、4、6)。
    • 传统判别模型评测:BERT、RoBERTa 等模型在 HED 上阈值 0.5 时的检测率为 15.0%–20.0%(k=1)和 12.0%–16.0%(k=3)(Table 8)。
  5. 有什么可以进一步探索的点?

    作者指出研究存在知情启动效应与评估近似性;评测覆盖13个系统与370名受试者。

    作者指出的局限与后续方向

    • 启动效应偏差:作者指出实验设计可能引入启动效应,因为参与者被预先告知研究涉及潜在有害语言并被要求识别,警惕性可能高于日常状态,因此识别率衡量的是知情且专注状态下的表现(第 6.1.1 节)。
    • 受试者报酬标准:作者承认 Prolific 的 8 美元/小时最低时薪属于底线标准,低于部分学术会议对涉及令人不适刺激研究的推荐报酬,将其列为局限并建议未来提高报酬(Ethical Considerations)。
    • 事后心理健康支持:研究未提供退出机制之外的事后心理健康跟进资源,作者判定正式跟进在极低风险分级下虽可免除,但仍标为一项局限(Ethical Considerations)。
    • 评估近似性与细粒度分析:作者指出由于人类感知的可变性和有限的用户研究规模,对人类可感知对抗文本的评估本质上具有挑战性,当前的评测是对实际部署的近似,更细粒度的分析有待未来工作展开(Appendix F.3)。
    • 防御机制定制需求:作者在附录讨论中指出,有效的防御需要将转换规则或不变性显式融入模型中,提示词层面的缓解手段难以泛化,需要专门的设计与工程实现(Appendix E)。

    实验覆盖范围

    • 被测系统覆盖范围:评测覆盖了 13 个主流文本审核系统(包括 6 家服务商的商业 API 及开源守卫模型)以及 4 个预训练判别模型(BERT、RoBERTa、XLM-RoBERTa、ParaDetox 分类器)。
    • 数据集与有害类别:有害样本来源于 AdvBench 筛选的 249 条不超过 10 个词的短文本,覆盖 5 个有害类别(Hate, Violence, Sexual Content, Self-Harm, Insults);良性文本取自 5 个公开评论数据集的五星好评。
    • 排版配置空间:共定义了 108 种全因子排版组合(3 种粒度 × 6 种放置方式 × 6 种样式变换),并调查了 5 个主流平台(Reddit、X、Discord、Stack Overflow、YouTube)的原生格式支持。
    • 用户研究规模:两轮在线用户研究共招募并完成了 370 名受试者(第一轮 120 人,第二轮 250 人),覆盖 31 个国家。
    • 未报告信息:论文未报告攻击在线系统的完整端到端响应耗时或计费开销;未报告攻击长篇复杂有害文本(超过 20 词)的效果。
  6. 总结一下论文的主要内容

    揭示了排版视觉线索与分词差异带来的审核盲区,HPAA以极低查询实现近乎完全规避。

    这篇论文研究了人类视觉感知与大模型分词处理机制之间的差异所导致的内容审核漏洞。

    • 核心问题:现代在线平台依赖基于分词的 LLM 审核系统,这类系统缺乏对空格、强调与空间排列等排版线索的处理能力,导致攻击者能够构造出人类一眼可识别、但模型判定为良性的有害内容。
    • 方法设计:提出了人类可感知对抗攻击(HPAA)框架,包含排版粒度(词/Token/混合)、放置策略(垂直/对角/随机)和样式变换(加粗/高亮/颜色/带圈字符等)共 108 种配置;通过两轮用户研究离线筛选高人类识别率的配置子集,并在黑盒设置下以极小查询预算(1–3 次)在线迭代规避检测。
    • 关键实验结果:
      • 在包含 13 个主流审核系统(如 GPT-4o、Gemini 2.5 Flash-Lite、Azure AI、Llama-Guard-3)的评测中,针对人类识别率达 92% 的配置,单次攻击将检测率普遍压低至接近 0%(最高不超过 16.67%)。
      • 在 3 次查询预算下,HPAA 规避率在全配置集合下达到 100%(对应最低 86% 人类识别率),在无高亮限制集合下也达到 100%(对应最低 84% 人类识别率)。
      • 传统对抗攻击(DeepWordBug、TextBugger、TextFooler)在被测系统上的规避率最高仅为 62.6%,大幅低于 HPAA。
    • 作者结论与启示:作者认为当前基于 LLM 的审核架构存在根本性的排版盲区,仅依靠提示词工程或阈值微调难以有效防御,防御方需探索与人类感知理解更好对齐的审核机制并显式引入排版不变性规则。
阅读原文arxiv.org