- 防御arXiv 2608.00716
生成图像更易被遗忘:面向合成图像检测的机器遗忘视角
提出机器遗忘式生成图像检测,用遗忘前后特征相似度区分自然图与生成图
- arXiv
- 2608.00716
- 发表
- 层
- 模型层
- 场景
- 模型与 API
摘要作者用剪枝或 LoRA 遗忘拉开生成图与自然图的特征相似度,并在多个检测基准上报告结果。
这篇工作把 AI 生成图像检测写成对预训练视觉模型的机器遗忘:原模型对两类图像损失都低,剪枝后生成图特征变得更不像原模型。
- 防御arXiv 2609.27399
GUARD:在 CosyVoice2 上做说话人身份遗忘以阻止重识别
提出 GUARD,在零样本 TTS 上用激活转向遗忘说话人身份以阻止再识别
- arXiv
- 2609.27399
- 发表
- 层
- 模型层
- 场景
- 模型与 API
摘要GUARD 用门控激活转向把退出说话人推向冒充相似度,以抑制再识别并保住音质。
GUARD 用门控激活转向做说话人身份遗忘,使零样本 TTS 对退出说话人难以再识别。
- 防御arXiv 2609.03629
EraseSAE:用稀疏自编码器在文生视频扩散模型中实现精准概念擦除
提出 EraseSAE,在文生视频模型中局部擦除指定概念
- arXiv
- 2609.03629
- 发表
- 层
- 模型层
- 场景
- 模型与 API
摘要EraseSAE 用单义特征局部擦除。
EraseSAE 把 SAE 用于 DiT 文生视频模型的概念擦除。作者要解决的是:全局改权重或表面负提示对不齐细粒度、分布式的概念,而且会改到无关时空区域。
- 可解释性arXiv 2609.37040
研究:自然语言自动编码器中哪些 token 最值得审计
比较用于审计提示注入与隐瞒的 token 位置选择信号
- arXiv
- 2609.37040
- 发表
- 层
- 模型层
- 场景
- 模型与 API
- 可解释性arXiv 2609.37737
研究用因果激活修补定位模型服从提示注入指令的决策层
用因果激活修补定位模型服从提示注入的决策层
- arXiv
- 2609.37737
- 发表
- 层
- 模型层
- 场景
- 模型与 API
- 攻击提示注入
摘要合规的因果杠杆集中在网络后三分之一的低秩子空间,该层也是混淆下检测最好的位置。
这篇工作用逐层激活修补定位提示注入合规发生在网络何处,并把该位置用于检测验证。。
已经到底了