防御arXiv 2608.29030
研究者提出自蒸馏方法让 LLM 遵循上下文水印指令
提出 SDLP 与 GRPO,训练模型遵循上下文水印指令
- arXiv
- 2608.29030
- 发表
- 场景
- 模型与 API
- 测试
- GPT-5.4、GPT-5.4-mini、GPT-5.4-nano 等 14 个
提出 SDLP 与 GRPO,训练模型遵循上下文水印指令
提出机器遗忘式生成图像检测,用遗忘前后特征相似度区分自然图与生成图
这篇工作把 AI 生成图像检测写成对预训练视觉模型的机器遗忘:原模型对两类图像损失都低,剪枝后生成图特征变得更不像原模型。
提出 GUARD,在零样本 TTS 上用激活转向遗忘说话人身份以阻止再识别
GUARD 用门控激活转向做说话人身份遗忘,使零样本 TTS 对退出说话人难以再识别。
提出 EraseSAE,在文生视频模型中局部擦除指定概念
EraseSAE 把 SAE 用于 DiT 文生视频模型的概念擦除。作者要解决的是:全局改权重或表面负提示对不齐细粒度、分布式的概念,而且会改到无关时空区域。