Nullify:面向 LLM 遗忘的零空间激活引导免训练方法
提出零空间激活引导 Nullify,免训练擦除指定记忆并保持效用
- arXiv
- 2610.10655
- 发表
- 层
- 模型层
- 场景
- 模型与 API
- 被测模型
- Llama-2-7B-chat-hf、Qwen3-8B
提出零空间激活引导 Nullify,免训练擦除指定记忆并保持效用
提出 MARCO 放射性水印,冻结蛋白质生成模型并在去噪时嵌入签名
MARCO 是加在蛋白质生成模型推理过程上的构象水印,用来标记知识产权,并为可能的生物安全滥用保留可追溯信号。作者还把它说成数字权利管理工具,以及符合生物武器公约的数字监管链。问题在于:专有 PGM 的三维输出可能被拿去训练盗版模型,也可能在来源被抹掉后绕过筛查。
提出 TRANSCOPE,用 CPU 硬件计数器推断训练集成员
摘要TRANSCOPE 揭示了分词器在嵌入表引发的硬件访问局部性差异,证实微架构计数器可突破恒定时间与置信度遮蔽防御。
构建多语言音视频 DeepFake 基准 BabelFake 并评测检测器
BabelFake 是经同意与 IRB 批准采集的多语音视频 DeepFake 检测基准,用来把视觉操纵和语音合成拆开比较。
提出 TRACER,从权重差识别扩散模型被擦除概念
TRACER 针对的是遗忘扩散模型上的目标识别:提供者从公开基座 W 用已发表方法擦掉未知集合 S⋆,只发布 W′。攻击者还有假定包含这些概念的词表,但不知擦了谁、擦了几个、用了什么算法。
把 SynthID 嵌入基因组语言模型采样,并用位置无关检测追溯生成序列
作者在两个六碱基基因组模型的采样里嵌入 SynthID,并让验证者在不知道起点、链和 token phase 时做一次校正后的检出。
提出 UnAct,仅以前向激活干预从分类器中遗忘指定类别
UnAct 是一种事后类别遗忘:删除请求可以只有少量该类图像,且没有标签和保留数据。它不用梯度,只对遗忘图像做前向。编辑对象是分类器所读的后期单元。
提出 THRIVE,为自回归 TTS 嵌入抗重建的多比特语音水印
提出 LiBRA,在潜空间双向优化以规避图像水印双侧检测
摘要LiBRA 用双向潜空间优化规避双侧水印检测,并提高相对反转基线的保真。
提出基准 OLMo-Detect 评测 LLM 成员推断
提出抗删除水印 RMCW,在生成时注入 Reed-Muller 结构并做局部检验
提出 HXAI 分层隐私解释框架,本地保留细解释并只发布加噪摘要
HXAI 是面向分布式能源系统的分层隐私保护解释框架,服务规划、监测与诊断,而不是实时控制。
提出 UNTAG,绕过开源权重模型的 trigger-tag 滥用检测
UNTAG 是针对开放权重 LLM 上条件滥用检测 trigger-tag 的统一攻击评估:信号可以在解码期注入,也可以写进权重,但攻击者若能改输出或改已发布权重,检测可以失效。
提出 TAILOR,按请求组合图像水印以满足抗攻击与画质延迟规格
提出用扰动蒸馏本地代理并离线过滤来提取黑盒模型凭据
摘要论文提出扰动蒸馏与离线过滤两阶段框架,实现了 output-only 访问下延迟降低的黑盒大模型 API key 提取。
提出成对无失真水印 TTMARK,增强低熵下的机器文本检测
TTMARK 是一种成对、无失真的文本水印:对相邻 token 的联合分布重加权,而不是逐 token 独立重加权。
提出用邻居分数替代参考模型的单轮成员推断
本文研究 one-round 成员推断:只有一个目标模型、不能再训练参考模型时,如何仍做逐样本校准,并用于单次运行的 DP 审计。
提出带密钥的 SNW,抵御事后图像水印的身份伪造
Gesny 与 Giboulot 针对生成内容追溯所依赖的多比特事后图像水印,批评端到端 DNN 方案既无容量理论、又无密钥。
提出 Leaky,用新鲜轨迹的 token 对数概率差推断 OPD 训练记录成员身份
提出 SCALPEL,用对比 SAE 在表征层选择性遗忘特定事实
SCALPEL 是不改基座权重的表征层遗忘方法,面向与保留数据重叠的窄目标。