摘要UnAct 用前向激活做类别遗忘。
UnAct 是一种事后类别遗忘:删除请求可以只有少量该类图像,且没有标签和保留数据。它不用梯度,只对遗忘图像做前向。编辑对象是分类器所读的后期单元。
- 攻击arXiv 2610.01365
ReGap:无需真实隐私数据即可通过微调重新提取模型隐私关联
提出 ReGap,用自生成伪监督微调恢复模型中的隐私关联
- arXiv
- 2610.01365
- 发表
- 场景
- 模型与 API
摘要提出无真实私有监督的恢复攻击 ReGap,实验显示微调可通过自生成数据唤醒模型潜在隐私关联,突显后适应隐私风险。
- 防御arXiv 2610.00209
基于差分隐私扩散模型的能源时间序列插补:裁剪感知的目标条件化方法
提出时间步感知目标条件化,改善差分隐私能源时序插补效用
- arXiv
- 2610.00209
- 发表
- 场景
- 模型与 API
- 攻击提取与窃取
摘要固定阈值 DP-SGD 下,v-prediction 加 ᾱt 加权降低能源时序插补误差,并降低后期低 SNR 的裁剪前梯度。
作者研究固定阈值 DP-SGD 训练的扩散模型,如何在余弦调度的后期低 SNR 时间步避免 ε-prediction 产生易被裁剪的大梯度,从而做能源时序缺失值恢复。
- 防御arXiv 2609.37858
存储不等于策略:面向 LLM 遗忘的状态条件支持控制
提出 Intervention Score 与 DIR-R,按干预效果选择并修订遗忘参数支持
- arXiv
- 2609.37858
- 发表
- 场景
- 模型与 API
摘要作者把局部化遗忘拆成初始干预选择和检查点修订,并在三个设置里分别给证据和边界。
Storage Is Not Strategy 研究局部化 LLM 遗忘里两个常被混在一起的决定:一开始该更新哪些参数,以及优化改变模型之后这个选择要不要改。
摘要论文提出基于主题锚点的数据中毒攻击,证明低比例的中毒样本可在黑盒条件下隐蔽放大微调指令泄漏。
摘要梯度上升类方法更接近简单评测下的重训参照,复杂方法会被知情攻击认出,多说话人更差。
已经到底了