UnAct:无需梯度的定向激活干预实现类别遗忘
提出 UnAct,仅以前向激活干预从分类器中遗忘指定类别
- arXiv
- 2610.04426
- 发表
- 层
- 模型层
- 场景
- 模型与 API
- 测试
- ResNet-18、ViT-B/16
摘要UnAct 用前向激活做类别遗忘。
UnAct 是一种事后类别遗忘:删除请求可以只有少量该类图像,且没有标签和保留数据。它不用梯度,只对遗忘图像做前向。编辑对象是分类器所读的后期单元。
另有 433 篇论文还没打上分类标签,暂不在筛选结果里。
提出 UnAct,仅以前向激活干预从分类器中遗忘指定类别
UnAct 是一种事后类别遗忘:删除请求可以只有少量该类图像,且没有标签和保留数据。它不用梯度,只对遗忘图像做前向。编辑对象是分类器所读的后期单元。
提出 Staged Decoding 与指令跟随训练,减少推理轨迹隐私泄露
本文把大推理模型的隐私问题做成轨迹可控性:隐私指令是指令,轨迹不跟随就会把敏感上下文写进可被提示注入导出的文本。
评测文生图模型的有害内容生成能力与审核检测缺口
提出基准 OLMo-Detect 评测 LLM 成员推断
提出 aiXamine 黑盒基准,统一评测 LLM 安全、稳健与隐私权衡
aiXamine 是一套黑盒评测协议,用来在同一条件下比较 LLM 的 safety、security 与 privacy,而不是再产出一个能力分。
提出机器遗忘式生成图像检测,用遗忘前后特征相似度区分自然图与生成图
这篇工作把 AI 生成图像检测写成对预训练视觉模型的机器遗忘:原模型对两类图像损失都低,剪枝后生成图特征变得更不像原模型。
提出 GUARD,在零样本 TTS 上用激活转向遗忘说话人身份以阻止再识别
GUARD 用门控激活转向做说话人身份遗忘,使零样本 TTS 对退出说话人难以再识别。
提出 SCALPEL,用对比 SAE 在表征层选择性遗忘特定事实
SCALPEL 是不改基座权重的表征层遗忘方法,面向与保留数据重叠的窄目标。
提出 PMA,用流形对齐从 E2EO 混淆向量恢复明文
提出 Collapse,从端侧混淆暴露视图抽取高效用替代模型
这篇工作用代数原语统一若干 TEE 卸载混淆,给出该族的典范边界,再说明该边界挡不住一种分阶段模型抽取。。
提出 VidMark 水印方案,核验视频生成模型的输出来源与所有权
Huang 等人提出一套面向视频生成模型的生成内嵌水印方案,用来同时判断一条视频是否来自受保护模型,以及一个嫌疑模型是否为该模型的拷贝。
提出 EraseSAE,在文生视频模型中局部擦除指定概念
EraseSAE 把 SAE 用于 DiT 文生视频模型的概念擦除。作者要解决的是:全局改权重或表面负提示对不齐细粒度、分布式的概念,而且会改到无关时空区域。
提出 ARIA,在冻结权重上用 SAE 做推理时遗忘门控
提出 Q-SKEW,利用 token 级记忆不对称推断微调扩散语言模型的成员
Q-SKEW 是针对微调扩散语言模型的 gray-box 成员推断指标,依据是 token 记忆增益随掩码率下降而增大、成员序列因此右偏。。
提出针对微调 TTS 的黑盒成员推断攻击
作者给出一个针对微调文本转语音模型的黑盒成员推断框架,分别审计说话人是否进入微调集,以及某一条文本–音频记录是否进入微调集。微调 TTS 以合成文本和参考语音双条件生成,既有生成模型 MIA 的单条件查询和图像/文本上的逐点比较不能直接套用。作者用 scorable extent 与 memorization elicitation 比较五种查询,认为只有 recitation(用目标转写和干净目标语音要求模型复现)同时满足两条,并把它作为主查询。
提出 RAPID,离线把抗蒸馏扰动写入文生图解码器
证明量子原生访问会增强量子模型的成员推断优势
作者研究 量子原生访问下 QNN 的成员推断:对手不再只拿到固定测量的经典比特。
提出严格黑盒成员推断 WPMIA,用采样估计词级概率判断训练成员
WPMIA 是面向严格黑盒的 LLM 预训练数据成员推断:攻击者只能看到文本续写。
系统比较解释获取路径下的抽取、成员推断与反演
提出 CGMIA,用成员推理检测代码生成基准的数据泄漏
CGMIA 用成员推断检测代码生成基准是否泄入 LLM 训练集,使评测不依赖对训练语料的直接访问。