- 防御arXiv 2608.00716
生成图像更易被遗忘:面向合成图像检测的机器遗忘视角
提出机器遗忘式生成图像检测,用遗忘前后特征相似度区分自然图与生成图
- arXiv
- 2608.00716
- 发表
- 层
- 模型层
- 场景
- 模型与 API
摘要作者用剪枝或 LoRA 遗忘拉开生成图与自然图的特征相似度,并在多个检测基准上报告结果。
这篇工作把 AI 生成图像检测写成对预训练视觉模型的机器遗忘:原模型对两类图像损失都低,剪枝后生成图特征变得更不像原模型。
- 防御arXiv 2609.27399
GUARD:在 CosyVoice2 上做说话人身份遗忘以阻止重识别
提出 GUARD,在零样本 TTS 上用激活转向遗忘说话人身份以阻止再识别
- arXiv
- 2609.27399
- 发表
- 层
- 模型层
- 场景
- 模型与 API
摘要GUARD 用门控激活转向把退出说话人推向冒充相似度,以抑制再识别并保住音质。
GUARD 用门控激活转向做说话人身份遗忘,使零样本 TTS 对退出说话人难以再识别。
- 防御arXiv 2609.21363
用扩散模型隐空间扰动防御视觉语言模型的地理位置隐私泄露
提出扩散潜空间地理扰动防御,抑制视觉语言模型泄露精确地理位置
- arXiv
- 2609.21363
- 发表
- 层
- 提示层
- 场景
- 模型与 API
- 攻击者
- 黑盒
- 防御arXiv 2609.03629
EraseSAE:用稀疏自编码器在文生视频扩散模型中实现精准概念擦除
提出 EraseSAE,在文生视频模型中局部擦除指定概念
- arXiv
- 2609.03629
- 发表
- 层
- 模型层
- 场景
- 模型与 API
摘要EraseSAE 用单义特征局部擦除。
EraseSAE 把 SAE 用于 DiT 文生视频模型的概念擦除。作者要解决的是:全局改权重或表面负提示对不齐细粒度、分布式的概念,而且会改到无关时空区域。
- 评测与基准arXiv 2609.35028
VEX-Bench:评测 LLM 生成虚假信息的核验复杂度
提出 VEX-Bench 评测 LLM 生成虚假信息的核查复杂度
- arXiv
- 2609.35028
- 发表
- 层
- 提示层
- 场景
- 模型与 API
- 攻击恶意使用
摘要VEX-Bench 用筛查时的五维复杂度衡量虚假信息对核查容量的占用,并报告生成与核查的成本差。
VEX-Bench 把 LLM 虚假信息的风险从“能否生成”改成“筛查时会占用多少核查容量”。
已经到底了