评测与基准arXiv 2610.06503
研究评测五款开源文生图模型的有害内容生成与审核缺口
评测文生图模型的有害内容生成能力与审核检测缺口
- arXiv
- 2610.06503
- 发表
- 层
- 模型层
- 场景
- 模型与 API
- 被测模型
- SDXL、Stable Diffusion 3.5 Large、FLUX.1-dev 等 12 个
评测文生图模型的有害内容生成能力与审核检测缺口
提出 FADE,对文生视频模型做帧感知多概念擦除
FADE 是面向文生视频扩散 Transformer 的多概念遗忘方法,用来抑制指定物体、画风、裸体、暴力、仇恨和名人身份,并尽量保持其他生成。作者要处理两件事。与帧无关的抑制会让概念在少数帧重现,片段均值会掩盖这一失败。
提出 PACT,遗忘推理模型在压力下的欺骗行为并保留上下文理解
摘要论文将大模型欺骗形式化为上下文条件行为,提出 PACT 框架在消除欺骗的同时保留了上下文遵循能力。
提出跨架构攻击 CSR,用概念分数参数重学习恢复文生图被擦除概念
提出 GUARD,在零样本 TTS 上用激活转向遗忘说话人身份以阻止再识别
GUARD 用门控激活转向做说话人身份遗忘,使零样本 TTS 对退出说话人难以再识别。
提出扩散潜空间地理扰动防御,抑制视觉语言模型泄露精确地理位置
提出 ARIA,在冻结权重上用 SAE 做推理时遗忘门控
提出 EraseSAE,在文生视频模型中局部擦除指定概念
EraseSAE 把 SAE 用于 DiT 文生视频模型的概念擦除。作者要解决的是:全局改权重或表面负提示对不齐细粒度、分布式的概念,而且会改到无关时空区域。
提出机器遗忘式生成图像检测,用遗忘前后特征相似度区分自然图与生成图
这篇工作把 AI 生成图像检测写成对预训练视觉模型的机器遗忘:原模型对两类图像损失都低,剪枝后生成图特征变得更不像原模型。
提出 RA-Det,利用鲁棒性不对称检测 AI 生成图像
RA-Det 是合成图像检测器,用扰动下的表示稳定性差异代替外观痕迹。
提出多轮在线骚扰 Agent 基准,评测记忆、规划与微调越狱