攻击arXiv 2610.01365
ReGap:无需真实隐私数据即可通过微调重新提取模型隐私关联
提出 ReGap,用自生成伪监督微调恢复模型中的隐私关联
- arXiv
- 2610.01365
- 发表
- 场景
- 模型与 API
- 测试
- GPT-2 Small、GPT-2 Medium、GPT-2 Large 等 6 个
摘要提出无真实私有监督的恢复攻击 ReGap,实验显示微调可通过自生成数据唤醒模型潜在隐私关联,突显后适应隐私风险。
提出 ReGap,用自生成伪监督微调恢复模型中的隐私关联
摘要提出无真实私有监督的恢复攻击 ReGap,实验显示微调可通过自生成数据唤醒模型潜在隐私关联,突显后适应隐私风险。
提出时间步感知目标条件化,改善差分隐私能源时序插补效用
作者研究固定阈值 DP-SGD 训练的扩散模型,如何在余弦调度的后期低 SNR 时间步避免 ε-prediction 产生易被裁剪的大梯度,从而做能源时序缺失值恢复。
提出 Intervention Score 与 DIR-R,按干预效果选择并修订遗忘参数支持
Storage Is Not Strategy 研究局部化 LLM 遗忘里两个常被混在一起的决定:一开始该更新哪些参数,以及优化改变模型之后这个选择要不要改。
提出 Fed-ADR,用编排服务器协同操纵梯度攻破联邦学习并检测恢复
Fed-ADR 是一套面向联邦学习的攻击、检测与恢复框架:编排服务器改写合谋客户端的梯度,使参数服务器的现有防御把投毒更新当成良性,同时在发现后用历史梯度把全局模型原地修回来。
提出主题锚点投毒,放大众包微调后的专有指令提取
摘要论文提出基于主题锚点的数据中毒攻击,证明低比例的中毒样本可在黑盒条件下隐蔽放大微调指令泄漏。
摘要梯度上升类方法更接近简单评测下的重训参照,复杂方法会被知情攻击认出,多说话人更差。