DeBERTa-ConPara:面向部署的 AI 生成文本检测,推理端 Unicode 归一化提升对抗鲁棒性
提出推理时 Unicode 归一化的检测器,识别遭字符级扰动的 AI 生成文本
- arXiv
- 2610.00883
- 发表
- 层
- 提示层
- 场景
- 模型与 API
- 测试
- microsoft/deberta-v3-large、deberta-v3-base、bert-large-cased 等 14 个
摘要推理时归一化消除两类 Unicode 攻击,训练时归一化则会删掉对抗监督。
DeBERTa-ConPara 是一个面向部署的 AI 文本检测器:DeBERTa-v3-large 在多数据集原始文本上训练,推理前做确定性 Unicode 归一化,用一个固定阈值面对没有目标域标签的场景。