评测与基准arXiv 2610.06503
研究评测五款开源文生图模型的有害内容生成与审核缺口
评测文生图模型的有害内容生成能力与审核检测缺口
- arXiv
- 2610.06503
- 发表
- 层
- 模型层
- 场景
- 模型与 API
- 测试
- SDXL、Stable Diffusion 3.5 Large、FLUX.1-dev 等 12 个
评测文生图模型的有害内容生成能力与审核检测缺口
提出 RASteer,推理时按保留子空间校正激活以擦除文生图目标概念
Retain-aware Activation Steering(RASteer) 是一种不改权重的推理时概念擦除方法,用于文生图扩散模型去掉指定概念并减少对保留概念的误伤。
提出黑盒攻击 DRIFT,偏转生成轨迹以去除扩散水印
用逐步 SAE 诊断文生图概念脆性,并推理时向类原型插值
作者用逐步稀疏自编码器审计文生图扩散模型里随物体变化的概念脆性,并用推理时原型插值检验该诊断。。
提出 NDDL,用良性扩散轨迹检测文生图后门提示并定位触发 token
NDDL 是面向文生图扩散模型的后门防御:防御者只有白盒模型访问和良性提示词,没有后门先验,需要区分后门提示词并找出触发 token。
提出 RAPID,离线把抗蒸馏扰动写入文生图解码器
提出用邻居分数替代参考模型的单轮成员推断
本文研究 one-round 成员推断:只有一个目标模型、不能再训练参考模型时,如何仍做逐样本校准,并用于单次运行的 DP 审计。