DeBERTa-ConPara:面向部署的 AI 生成文本检测,推理端 Unicode 归一化提升对抗鲁棒性
DeBERTa-ConPara: Attack-Aware and Deployment-Realistic Detection of AI-Generated Text
DeBERTa-ConPara 在 RAID 隐藏测试上以原始语料训练、推理时 Unicode 归一化,TPR@1% FPR 达 96.57%,增益集中在同形字与零宽空格两类攻击。
部署条件下的事后检测:攻击者用 RAID 的 12 类字符/格式与改写扰动(含 homoglyph、zero-width)改变输入表面,语义大致保留;检测器无目标域标签做阈值校准。
- 部署中检测 AI 生成文本会同时遇到域与生成器偏移、字符级对抗扰动,以及没有目标域标签可供逐集校准阈值。作者认为事后检测仍是实际设定,因为水印需要生成器配合。
- DeBERTa-ConPara 以 DeBERTa-v3-large 编码原始文本,仅在推理前做确定性 Unicode 归一化(同形字、NFKD、Cf 格式符、空白折叠)。2×2×2 因子实验独立变化训练时归一化、推理时归一化和手工特征融合;ConPara 改写与对比学习为负结果。
- 作者报告官方 RAID 隐藏测试上该配置 AUROC 99.61%、TPR@5% FPR 99.01%、TPR@1% FPR 96.57%;homoglyph 与 zero-width 从 11.05% 和 1.12% 升至 96.98%,其余十类攻击惩罚约在 1 个百分点内。固定阈值下 HC3 Plus 与 MAGE 平均 balanced accuracy 为 93.14%。特征分支在八个条件中均为负。
- 作者指出每配置仅单次训练,三种子的 TPR@1% FPR 相差 10.68 个百分点;实验只覆盖英文;语义保持改写、AI 辅助写作和模仿个人风格仍未解决。评测覆盖 RAID 十二类攻击、四个无特征单元的跨数据集固定阈值,以及 Fast-DetectGPT 上的同类签名。
- 威胁模型
- 部署条件下的事后检测:攻击者用 RAID 的 12 类字符/格式与改写扰动(含 homoglyph、zero-width)改变输入表面,语义大致保留;检测器无目标域标签做阈值校准。知识设定论文未用 white-box/black-box 表述。
- 模型
- microsoft/deberta-v3-largedeberta-v3-basebert-large-casedroberta-largeFast-DetectGPTMELDModernBERTDesklib v1.01SuperAnnotatee5-small-loraTMRBERT-tiny-4MADALRADAR
- 基准
- RAID hidden testHC3 PlusHC3-QAHC3-SIMAGEM4M4GT-BenchSemEval-2024PeerReadWikiHow
- 指标
- AUROCTPR@5% FPRTPR@1% FPRbalanced accuracyattack penalty
研究者提出 DeBERTa-ConPara,一个面向部署的 AI 生成文本检测器,将攻击感知的 Unicode 预处理与基于 HC3 Plus、M4、MAGE 和 RAID 训练的上下文 Transformer 编码器结合。核心发现是预处理方向相反:对训练语料做归一化会去重,把 35.4% 的 RAID 行折叠成其干净样本的副本并删除对抗监督,而在推理端归一化则是有效防御。独立变化两种放置方式的析因实验显示,原始训练加归一化推理是最佳配置,在官方 RAID 隐藏测试上达到 99.61% AUROC、99.01% TPR@5% FPR 和 96.57% TPR@1% FPR,在固定阈值下于 HC3 Plus 和 MAGE 上平均平衡准确率为 93.14%。增益仅集中在十二类攻击中的两类:同形字和零宽空格插入从 11.05% 和 1.12% 提升到 96.98%。
深度解读
这篇论文试图解决什么问题?
部署中既要扛字符级攻击,又不能靠目标域标签逐集调阈值。
如何在没有目标域标签、又面临字符级表面攻击时,稳定检测 AI 生成文本。
- 场景:作者称 LLM 使机器文本在教育、新闻、科研出版和在线交流中更难与人类写作区分,并带来虚假信息、学术不诚实、合成评论和协同不真实行为。事后检测是他们要解决的设定,因为水印需要生成器配合,且不覆盖已经生成的文本。
- 现有不足:作者称许多检测器域内表现强,但在未见生成器、域偏移、解码变化和对抗扰动下下降。两类部署问题被单独点出:评测常在测试时为每个数据集或域单独调阈值,而实际往往没有目标域标签;许多攻击发生在字符和格式层,利用 Unicode 处理与分词,在语义建模之前就起作用。同形字替换和零宽 Unicode 字符会扰乱依赖分词的流程,同时保留语义。
- 核心观察:归一化用在训练语料和用在推理时方向相反。作者称对训练语料归一化会去重,使 RAID 行中 35.4% 变成其干净副本并删掉对抗监督;推理时归一化则是有效防御。
- 提出的方法:作者提出 DeBERTa-ConPara,把攻击感知的 Unicode 预处理与在 HC3 Plus、M4、MAGE、RAID 上训练的上下文编码器结合起来。报告配置是原始文本训练、仅推理时归一化、不带手工特征分支。
- 威胁模型:
- 目标:把 AI 生成文本与人类写作区分开,并在部署式固定阈值下保持对表面扰动的检测。
- 知识:论文未用 white-box、black-box 或 gray-box 描述攻击者;检测器是事后分类器,不假设能改生成过程。
- 能力:攻击改变输入表面。RAID 覆盖改写、同形字、空白、零宽 Unicode 和结构操作等十二类;同形字、零宽空格和空白操作被作者称为纯字符替换,归一化可还原原文。
- 受害系统:分词敏感的检测流水线。作者称脆弱性来自分词把同形字词切成子词,而不是某一个模型独有。
有哪些相关研究?
相关工作分零样本统计、有监督、水印和域泛化;作者把缺口放在分词前的表面扰动。
作者把检测分成零样本统计、有监督分类和水印三类,并另写域泛化与对抗鲁棒。
零样本与统计检测
- GLTR(Gehrmann 等,2019)、DetectGPT(Mitchell 等,2023)、Fast-DetectGPT(Bao 等,2024)、Binoculars(Hans 等,2024):不经任务监督,用 token 分布、概率曲率或跨模型似然识别机器文本。作者称它们计算较轻、便于未见生成器,但先前工作显示在域偏移、解码变化和对抗改写下会下降,固定阈值、无法做目标域校准时更明显。
- Ghostbuster(Verma 等,2024)与 SurpMark(Chen 和 Khisti,2026):前者用文体与概率信号做跨域泛化;后者用 token surprisal 动态对照固定的人类与机器参考打分,以避免曲率方法逐条输入的对比生成。作者讨论的是打分模型与未知生成器不一致时的 proxy-model mismatch。
有监督检测
- BERT(Devlin 等,2019)、RoBERTa(Liu 等,2019):在 HC3(Guo 等,2023)、HC3 Plus(Su 等,2023)等上微调人类/AI 文本。作者称有监督方法域内常接近上限,大规模基准上跨生成器、跨域会下降,并可能过拟合生成器痕迹、文体或解码特征。
- RADAR(Hu 等,2023)、RepreGuard(Chen 等,2025)、MGT-Prism(Liu 等,2026):分别通过对抗训练应对改写、从隐藏表示而非输出概率检测、用谱对齐改善跨域跨生成器泛化。Krishna 等(2023)被引为改写即可绕过许多检测器,从而推动对抗训练和语义不变增强。
- DetectRL(Wu 等,2024)、RAID(Dugan 等,2024):前者显示检测器在自然分布偏移和对抗条件下下降;后者是大规模对抗基准,覆盖改写、同形字、空白、零宽字符和结构操作。作者称现有方法多针对语义攻击,对分词前表面扰动的显式缓解关注较少。
水印
- Kirchenbauer 等(2023)、Wouters(2024)、Zhang 等(2024):在生成时嵌入可检测信号,而非事后分析。作者称改写和保语义重写会使水印鲁棒性下降,且水印不覆盖已生成文本。
域泛化
- EAGLE(Bhattacharjee 等,2024):用域对抗与对比学习鼓励生成器不变表示。作者把它与 MGT-Prism 并列为针对域偏移和对抗扰动的工作,未再单独批评。
基线与基准:官方 RAID 隐藏测试;跨数据集用 HC3 Plus(HC3-QA、HC3-SI)、MAGE,另有 M4、M4GT-Bench。公开检查点基线包括 MELD、ModernBERT、Desklib v1.01、SuperAnnotate、e5-small-lora、TMR、BERT-tiny-4M、ADAL、RADAR;有监督对照是既无攻击感知预处理也无手工特征的微调 DeBERTa-v3-large。零样本复现用 Fast-DetectGPT。
作者把本文放在组合上:推理时归一化防御表面攻击,但训练时归一化会删掉对抗监督;多数据集训练同时保留跨数据集泛化。声称限制在所评的英文域、生成器和攻击。作者称若干排行榜系统仅在 RAID 上更高。
论文如何解决这个问题?
原始语料训练、推理时做四步 Unicode 归一化,特征融合与 ConPara 被报告为负结果。
DeBERTa-ConPara 用 DeBERTa-v3-large 编码文本,分类头只吃分类 token 的表示;攻击感知预处理只在推理、分词之前施加。特征融合和语义不变增强(ConPara)写进了因子实验,但不是报告配置。
问题设定与数据
- 训练语料:1,549,358 行,人类与 AI 文本恰好平衡,另有 172,826 行做验证(Table 1)。构成是 RAID 530,534、M4 人类填充 438,305、MAGE 319,071、HC3 Plus 148,040、M4 70,349、PeerRead 28,047、WikiHow 15,012。RAID 中 AI 398,834 行、人类 131,700 行;M4 人类填充不含 AI 文本。域与生成器计数描述基准本身,不是抽样子集。
- 较新生成器:四个公开基准的生成器停留在 2023。PeerRead 与 WikiHow 由作者生成,共 43,059 行,是语料里唯一接触较新模型的部分。PeerRead 用 ChatGPT、LLaMA 与 LLaMA-2-chat(7B、13B、70B);WikiHow 用 Claude、GPT-4o、Grok、Qwen-14B、LLaMA-3-8B、Mistral-7B、Cohere。
- 固定阈值:τ⋆ 在源验证集上最大化 balanced accuracy(Youden,1950)后,对所有目标分布保持不变。RAID 另按官方隐藏测试:在每个域的人类文本上把阈值校准到恰好 5% FPR,主指标为 TPR@5% FPR,并报 TPR@1% FPR 与 AUROC。
编码器与分类头
- 骨干:microsoft/deberta-v3-large,24 层、隐藏维 1024,解耦注意力加 ELECTRA 式 RTD。取分类 token 的最后隐状态为 h_cls ∈ R^1024。投稿版本用 deberta-v3-base;语料扩到 1.55M 行后,在数据、超参和种子相同、训练五个 epoch 的条件下,作者称较大骨干更好:最优阈值 balanced accuracy 从 94.56% 到 96.58%,AUROC 从 0.98655 到 0.99328。骨干更换与语料扩展是一起采用的。
- 报告配置的头:1024 → 512 → GELU → Dropout(0.1) → 2。有特征分支时输入为 2048 维,头为 2048 → 512 → GELU → Dropout(0.1) → 2。
- 训练:AdamW,weight decay 0.01,峰值学习率 2×10^−5,batch size 32,最大长度 512,OneCycleLR 余弦退火。报告检查点取验证 balanced accuracy 最好的 epoch。完整超参见附录 A.2.4。
攻击感知预处理
- 顺序(Table 7 有分阶段说明):用覆盖西里尔、希腊、全角和风格化拉丁的 confusables 表做同形字替换;智能引号、破折号和分数规范成 ASCII;NFKD 分解并去掉组合附加符,再 NFC 重组;删除全部 Unicode 格式字符(类别 Cf,含零宽和方向标记);折叠空白。作者称同形字在规范上不同,仅分解修不好。流水线确定且幂等,开销可忽略。
- 放置:训练时归一化会把纯字符攻击还原成原文。RAID 有 13,371 篇不重复人类文章、十二种攻击变体;同形字、零宽空格和空白操作被还原后,攻击行与干净行字节相同并被去重丢掉。在匹配的 1,892 行样本上,归一化后保留 1,223 个不同文本,相对原始 1,892 个,作者称归一化使 RAID 的 35.4% 折叠并去掉这三类攻击。因此 n 训练的四个单元看到的 RAID 行大约少 35%。报告配置是原始文本训练、只在推理归一化。
被消融的特征分支
- 特征:62 个手工语言与统计特征,类别含概率、文体、可读性和词汇多样性。在训练集上用互信息选 top k=30,RobustScaler 标准化。完整列表在附录 A.2.2。
- 门控:投影到 1024 维后与 h_cls 拼接,一个标量门 g 整体放行或抑制投影特征,而不是按坐标重加权。融合向量为 h_cls 与 g·f′ 的拼接,维数 2048。公式 (1) 定义该门控;g 为 logistic 输出。该分支是 2×2×2 中的一个因子,Figure 1 用虚线标出,不在报告模型里。
ConPara 与因子设计
- 改写增强:对选定训练样本用 flan-t5-base 生成改写,句向量余弦相似度 ≥ 0.85 才保留。作者称更低阈值会改变意思,更高阈值在预实验中去掉有用多样性。
- SupCon:改写作正对、异类作负样本,目标是加权交叉熵加 SupCon,λ ∈ {0.05, 0.1, 0.2},由消融选取(附录 A.2.3 的公式 3)。作者称 ConPara 不能改进最佳配置。
- 因子:训练时是否归一化 × 推理时是否归一化 × 有无特征分支,共八个单元,同一源语料、相同超参和固定种子,全部提交官方 RAID 隐藏测试,标签作者未见。
论文做了哪些实验?
八格因子显示推理归一化总是有益,增益几乎只来自同形字和零宽空格。
实验设置
- 被测模型:报告配置为 microsoft/deberta-v3-large。骨干对照为 bert-large-cased、roberta-large,以及曾用的 deberta-v3-base。零样本复现为 Fast-DetectGPT。公开检查点对照为 MELD、ModernBERT、Desklib v1.01、SuperAnnotate、e5-small-lora、TMR、BERT-tiny-4M、ADAL、RADAR。
- 数据:训练 1,549,358 行,验证 172,826 行。RAID 隐藏测试为 672,000 行(Table 2)。另评 HC3-QA、HC3-SI、MAGE、M4GT-Bench;特征分支的分布外样本包括 SemEval-2024 与 HC3-SI。全量 RAID 训练切分为 9.38M 平衡行。
- 协议:源验证集上一次校准 τ⋆,跨目标保持不变。RAID 按官方协议在各域人类文本上校准到 5% FPR。指标为 AUROC、TPR@5% FPR、TPR@1% FPR、未攻击行的 TPR@1%(T1cl)和攻击惩罚 pen = T1cl − T1。跨数据集用固定阈值 balanced accuracy。
- 因子:Ft 为特征分支,Tr/Inf 为训练与推理是否归一化(n/r)。−F r→r 是审稿要求的普通微调 DeBERTa-v3-large。八格共用超参和固定种子。
- 评审:阈值来自 balanced accuracy 最大化或官方 FPR 校准,论文未写 LLM 评审。
主结果
RAID 隐藏测试 672,000 行,八格全部提交(Table 2)。最后一行是报告配置。
表格较宽,可左右滑动
配置 AUROC TPR@5% TPR@1% pen +F n→n 99.48 98.84 87.45 1.38 +F n→r 97.32 92.76 75.59 12.79 +F r→r 99.39 98.83 93.64 2.13 +F r→n 99.51 99.02 94.72 0.56 −F n→n 99.54 98.50 94.52 0.92 −F n→r 95.77 86.14 79.48 15.80 −F r→r 99.35 98.39 93.78 3.39 −F r→n 99.61 99.01 96.57 0.41 据 Table 2。TPR 列为百分数;pen 为百分点。未攻击行 T1cl 未全部列入上表:报告配置为 96.98,与 homoglyph、zero-width 在推理归一化下的检出率相同。
- 放置方向相反:作者称推理时归一化在 TPR@1% FPR 上总是有益,增益为 +1.08 到 +15.04 个百分点,最大出现在模型只见过归一化文本、因而没见过攻击时(+11.86 和 +15.04),原始训练已经见过攻击时较小(+1.08 和 +2.79)。原始语料训练总是有益,+2.05 到 +18.05 个百分点。
- 两类攻击:十二类里十类相对未攻击文本的惩罚在各配置上大约一个百分点以内。没有推理归一化时,归一化训练的模型在 1% FPR 下检出 homoglyph 11.05%、zero-width 1.12%;加上推理归一化后两者都到 96.98%。作者称归一化不是减弱这两类攻击,而是消除它们。仅原始训练时 homoglyph 到 85.78%、zero-width 到 73.80%,再加推理归一化才到 96.98%。改写的绝对率在八格间为 75.9% 到 90.4%,该变化为各格共有。
- 不匹配:攻击惩罚列中六格低于 3.4 个百分点;损失 12.79 和 15.80 的两格正是归一化训练、原始文本评测。作者称鲁棒性是训练语料与推理流水线是否一致,而不是模型属性。同一两类攻击签名在 Fast-DetectGPT 上再现(附录 B);该检测器分词器不同且没有训练头。
特征分支与骨干
- 分支始终为负:四个条件的代价为 7.07、3.89、1.85 和 0.14 个百分点,在投稿所用的全归一化设定上最贵。八个 RAID 域里七个上 TPR@1% FPR 变化最多几个点,abstracts 上略有益;poetry 上在全归一化配置中为 38.1%(有分支)对 87.9%(无分支),差 49.8 个百分点。原始文本训练后该惩罚降到 7.8 个百分点,poetry 仍是各条件下分支损害最大的域(附录 G,Table 20)。
- 隔离实验:在同一检查点、相同 20,000 行上,把投影表示置零与把门强制为 0 给出逐比特相同的 margin。去掉分支使 logit margin 平均移动 1.751,AUROC 到四位小数不变(0.99326 对 0.99336),TPR@1% FPR 降 0.40 个百分点。无分支训练的模型为 92.30%,有分支为 92.31%。分布外有害:SemEval-2024 上 TPR@1% FPR 损失 23.4 个百分点,HC3-SI 上 7.7 个百分点。零输入不等于去掉分支,因为投影是仿射的,零输入仍输出偏置,值 0.172 logits。
- 骨干:三套分词器都把同形字词切成子词而不是未知 token。隐藏测试上 DeBERTa 的 AUROC 为 99.61%,BERT 99.07%,RoBERTa 94.32%;作者称 DeBERTa 在 TPR@1% FPR 上领先 BERT 六个点、领先 RoBERTa 二十五个点(Table 16)。验证池上的排序没有保持:RoBERTa 在验证池领先 BERT 九个点,在隐藏测试上落后十九个点。
数据规模与跨数据集
- 放大 RAID:最佳配置在完整 RAID 训练切分(9.38M 平衡行,约六倍对抗暴露)上训练,按验证 AUROC 在第二 epoch 选取。隐藏测试到 99.63% AUROC、97.12% TPR@1% FPR,比 1.55M 配置高 0.55 个百分点。在两边训练集都没有的来源上,该模型在 MAGE 上 TPR@1% FPR 从 91.99 降到 88.57(不相交的 95% 区间),损失 3.42 个百分点;跨数据集平均从 93.14% 降到 92.45%(Table 3)。作者因此仍以 1.55M 配置为主系统。验证集中 MAGE 相对训练过代表时,早停使 HC3-SI 损失三个点,改成按比例后恢复(附录 F)。
- 固定阈值外部集(Table 3,balanced accuracy;RAID 列为官方 TPR@5% FPR):四个无特征单元的 HC3-QA / HC3-SI / MAGE 平均为 93.35、93.55、93.17、93.14。报告配置 −F r→n 为 HC3-QA 99.69、HC3-SI 83.50、MAGE 96.23、RAID 99.01。预处理放置在 RAID 上把单元分开 12.9 个百分点,在这里最多 0.41 个百分点。只改推理的成对权重在每个基准上 AUROC 与 TPR@1% FPR 到四位小数一致。作者称 HC3 Plus 与 MAGE 没有 Unicode 扰动,归一化无东西可删。原始训练相对中性:HC3-SI 大约损失两个点、M4 一个点、MAGE 增益一个点,平均净变化在半个点以内;对照 RAID TPR@1% FPR 上 17.1 个百分点的增益,作者认为这一交换可接受。
- 公开检查点(同一固定阈值协议,Table 3):MELD 是唯一在 RAID 上高于本文的开放系统(99.78 对 99.01),其平均为 85.89(HC3-QA 94.64、HC3-SI 66.86、MAGE 96.17)。作者称本文配置的跨数据集平均领先 MELD 7.3 个点;在 RAID 上接近的 ADAL、TMR 在 HC3-SI 上接近随机(ADAL 44.89,TPR 列按表为 balanced accuracy)。HC3、MAGE、M4 是本文训练来源,这些列对本文是留出切分、对竞争者是外部数据,作者称这在构造上有利于本文。若干商业系统 RAID 高于 99 但没有公开检查点。ModernBERT 在 MAGE 上为分布内。特征单元未做外部评测。
其他消融与分析
- M4GT-Bench(未参与训练):+F n→n、−F n→n、+F r→r、−F r→n 的 TPR@1% FPR 为 97.67%、94.55%、96.70%、93.59%。这是特征分支有帮助的唯一外部语料,两种训练条件下大约三个点,符号与 SemEval-2024、HC3-SI 相反。
- ConPara:改写增强与 SupCon 不能改进最佳配置;λ 的具体消融数字在正文未逐项列出。
- Figure 10 / 11:报告配置(−F,raw→norm)全尺寸的生成器×攻击、域×攻击热力图,格内为 TPR@1% FPR。poetry 一行中有一格为 78,recipes 多为 100;mistral 一行有一格为 80,llama-chat 多为 100。攻击轴标签因转写残缺,不把单个格子对应到具体攻击名。
- 多种子:同一配置三个种子的隐藏测试 TPR@1% FPR 跨度 10.68 个百分点;同一系统五种子上 balanced accuracy 变化 ±0.75 个百分点(附录 A.3.3)。
- 负结果:特征分支在分布内惰性、分布外有害;训练时归一化删掉对抗监督。投稿版在构建时已经归一化,A1/A3 的差异因此反映训练/测试不匹配,而不是预处理本身的效应。
有什么可以进一步探索的点?
作者把单次运行方差、只做英文、改写与 AI 辅助写作列为后续问题。
作者指出的局限与后续方向
- 单次运行:每个配置是一次训练。一个配置的三个种子在隐藏测试 TPR@1% FPR 上相差 10.68 个百分点。作者称因子比较是配对的,但没有重复整个因子实验,因此无法量化配对方差;几个点的格间差异只作指示。结论放在相对该跨度较大或四个条件符号一致的效应上(Limitations)。
- 只覆盖英文:全部实验只用英文数据,鲁棒性主张只适用于所评的英文域、生成器和攻击。作者称扩展到多语言是重要方向;DetectRL-X 跨八种语言、六个域,检测表现随文字系统不均匀变化,攻击感知归一化能否迁到非拉丁文字,他们的结果没有回答(Limitations)。
- 语义保持变换:表面扰动之外,复杂改写对当前检测系统仍然困难(Limitations)。
- 人类文本年代与三类检测:人类训练文本来自 2022 年前。作者认为人类写作风格会随 AI 使用变化,AI 辅助写作是二元检测未处理的中间类,并把人类、AI 辅助、完全 AI 生成的三类检测视为未来方向(Limitations)。
- 基准与新攻击:鲁棒性评测受现有基准和攻击策略约束。作者提到故意降低可检测性的后处理 humanisation 过滤器,以及模仿个人用词、句法和特有错误的个性化系统会使文体检测按设计失效,需要作者自适应检测并持续更新基准(Limitations)。
- 讨论中的可操作边界:推理时归一化没有可学习参数,已有检测器可以不重新训练就采用;它不能代替训练期间的对抗暴露(Discussion)。
实验覆盖范围
- 因子与测试:2×2×2 八格全部提交 672,000 行 RAID 隐藏测试(Table 2,Section 5.2),标签作者未见。训练行为归一化及其造成的去重。
- 攻击分解:增益被归到十二类中的 homoglyph 与 zero-width;同一签名在 Fast-DetectGPT 上复现(附录 B)。十类的惩罚在各配置上大约一个百分点以内。
- 跨数据集:四个无特征单元在 HC3-QA、HC3-SI、MAGE 上用一次校准的 τ⋆(Table 3);M4GT-Bench 四个指定单元报告了 TPR@1% FPR。特征单元未做 Table 3 的外部评测。
- 规模与骨干:1.55M 行主系统与 9.38M 行全 RAID 切分都有隐藏测试数字(Section 5.4)。骨干对照为 DeBERTa-v3-large、BERT-large、RoBERTa-large(Table 16)。
- 稳定性:附录 A.3.3 报告一个配置三个种子的 TPR@1% FPR,以及五种子的 balanced accuracy。论文未报告重复整个八格因子后的配对方差。
总结一下论文的主要内容
推理时归一化消除两类 Unicode 攻击,训练时归一化则会删掉对抗监督。
DeBERTa-ConPara 是一个面向部署的 AI 文本检测器:DeBERTa-v3-large 在多数据集原始文本上训练,推理前做确定性 Unicode 归一化,用一个固定阈值面对没有目标域标签的场景。
- 问题:域内检测器在未见生成器、域偏移和字符级扰动下下降;测试时逐集调阈值在部署中往往做不到。水印需要生成器配合,事后检测仍是作者要做的设定。
- 做法:预处理依次处理同形字、排版符号、NFKD/NFC、全部 Cf 格式符和空白。归一化训练会把 RAID 中约 35.4% 的行收成干净副本并去掉对抗监督,所以报告配置不在训练时归一化,也不使用 62 维手工特征的门控分支。改写加 SupCon 的 ConPara 同样不能改进该配置。
- RAID:672,000 行隐藏测试上,−F raw→norm 的 AUROC 为 99.61%,TPR@5% FPR 为 99.01%,TPR@1% FPR 为 96.57%(Table 2)。推理归一化使 homoglyph 与 zero-width 的 TPR@1% FPR 从 11.05% 和 1.12% 到 96.98%,与未攻击文本相同;另外十类的惩罚大约一个百分点。八格里特征分支都降低 TPR@1% FPR,poetry 上全归一化时差 49.8 个百分点。
- 泛化:同一配置在 HC3-QA、HC3-SI、MAGE 上固定阈值平均 balanced accuracy 为 93.14%(Table 3)。公开检查点里 MELD 的 RAID TPR@5% FPR 为 99.78,跨数据集平均为 85.89。把对抗数据扩到 9.38M 行,隐藏测试 TPR@1% FPR 到 97.12%,MAGE 上无泄漏评测从 91.99 降到 88.57。Fast-DetectGPT 出现同一两类攻击签名。
- 作者的结论:归一化必须放在推理、分词之前,训练仍需要原始对抗文本。特征分支在分布内惰性、分布外有害。主张限于所评英文域、生成器和攻击;几个点的差异受单次运行影响,TPR@1% FPR 在三种子间相差 10.68 个百分点。