全部动态
从来源,看到研究的联系
点选节点,展开一条线索
本页材料
完整标题与摘要 · 24 条- 会议论文ICLR 2025
我的数据被用了多少?机器学习中的定量数据使用推断
提出数据集使用基数推断方法DUCI,利用去偏成员推断量化模型训练使用特定数据的比例,以极低计算成本达到接近最优MLE的精度。
- 会议论文ICLR 2025
对抗性Mixup机器遗忘
针对机器遗忘保护数据隐私过程中易导致的灾难性遗忘问题,提出生成器-遗忘器对抗框架MixUnlearn,利用合成样本在擦除敏感信息的同时保留核心知识。
- 会议论文ICLR 2025
分布内与分布外机器遗忘的效用与复杂度
分析了近似机器遗忘的效用与复杂度权衡,并针对时间复杂度可能超过重训的分布外遗忘数据,提出带噪鲁棒梯度下降变体以降低计算成本。
- 会议论文ICLR 2025
ConcreTizer:面向3D点云重建的模型反演攻击
提出针对体素化3D点云的模型反演攻击ConcreTizer,通过体素占用分类与色散控制监督,有效从受损特征中还原敏感的3D点云场景数据。
- 会议论文ICLR 2025
基于域对抗训练表示消除的选择性机器遗忘
提出遗忘算法SURE,将遗忘转化为域对抗问题并通过梯度反转混淆遗忘集特征表示,有效抵御了通过模型嵌入检测遗忘样本的高级攻击。
- 会议论文ICLR 2025
CPSample:扩散生成中保护训练数据的分类器保护采样
提出在采样过程中利用分类器引导避开训练数据分布,防止扩散模型精确复现训练数据并增强抵御成员推断攻击的能力。
- 会议论文ICLR 2025
DiSK:基于简化卡尔曼滤波降噪的差分隐私优化器
提出差分隐私优化器DiSK,利用简化的卡尔曼滤波对加噪梯度进行去噪,显著改善大规模模型训练中的隐私与效用权衡。
- 会议论文ICLR 2025
缓解语言模型中的训练数据记忆现象
系统评估正则化、微调及机器遗忘方法以消除语言模型对私密训练数据的记忆,提出遗忘方法BalancedSubnet有效移除了记忆信息。
- 会议论文ICLR 2025
深入探究大语言模型的机器遗忘
针对LLM记忆敏感内容引发的隐私与法律风险,提出评估遗忘输出的新指标,并分别通过最大熵目标与答案保留损失改进非定向和定向机器遗忘方法。
- 会议论文ICLR 2025
基于核密度的 shuffled 差分隐私终端用户数据学习
提出 shuffled DP 协议估计分布式数据的核密度函数,精度接近中心化 DP,并用于私有地学习分类器。
- 会议论文ICLR 2025
扩散模型中的数据遗忘学习
针对扩散模型记忆和复现训练数据的问题,提出带理论保证的SISS损失函数,通过重要性采样高效擦除特定数据点,在保持质量的同时显著缓解记忆问题。
- 会议论文ICLR 2025
MUSE:大语言模型机器遗忘的六维评估基准
提出包含无记忆与无隐私泄露等六维属性的机器遗忘基准MUSE,评测发现多数算法虽能消除记忆但损害通用效用,且仅有一种算法未造成严重隐私泄露。
- 会议论文ICLR 2025
代码补全RLHF中的记忆效应度量
分析RLHF与直接偏好优化各阶段对训练数据记忆与复现的影响,发现相比直接偏好学习,RLHF能更有效降低敏感偏好数据泄露的隐私风险。
- 会议论文ICLR 2025
听我指令全盘托出:检索增强生成系统的可扩展数据提取
揭示攻击者可通过提示注入利用指令跟随能力逐字提取RAG知识库数据,在定制GPTs上以极高成功率外泄了大量文本数据。
- 会议论文ICLR 2025
LaW:面向大语言模型的大规模知识清洗方法
针对LLM记忆私密、有毒及版权知识的风险,提出通过更新特定MLP层进行大规模知识遗忘的方法LaW,在有效遗忘目标知识的同时最大程度保留推理能力。
- 会议论文ICLR 2025
矩阵机制在 ℓ_p^p 度量下的最优性
在差分隐私下回答线性查询,刻画 ℓ_p^p 误差并给出前缀和与奇偶查询的紧界。
- 会议论文ICLR 2025
DocMIA:针对 DocVQA 模型的文档级成员推断攻击
提出白盒与黑盒两种无需辅助数据集的无监督成员推断攻击,在多种 DocVQA 模型和数据集上优于现有方法,揭示文档模型的隐私风险。
- 会议论文ICLR 2025
TDDBench:训练数据检测基准
构建了包含多模态数据集的基准TDDBench,系统评测21种训练数据检测与成员推断方法,发现现有算法在各数据集上表现普遍不佳。
- 会议论文ICLR 2025
从梯度视角反思大语言模型遗忘学习目标
为消除模型中的隐私侵权等风险,提出从梯度视角量化遗忘目标影响的指标G-effect,揭示了现有目标的缺陷并探索改进方案。
- 会议论文ICLR 2025
大语言模型的主动隐私遗忘机制:在极低效用损失下保护PII
提出主动隐私遗忘机制PPA,通过识别并遗忘与个人身份信息最相关的关键记忆并植入替代记忆,在保持模型效用的同时大幅降低恶意攻击下的PII泄露风险。
- 会议论文ICLR 2025
基于自适应模型融合的版权保护语言生成
提出在推理阶段融合模型的CP-Fuse方法,自适应聚合输出以显著减少受版权保护内容的复现,防止记忆数据泄露并有效抵御训练数据提取攻击。
- 会议论文ICLR 2025
Ward:基于大模型水印的可证明RAG数据集推断
形式化了检索增强生成中的黑盒数据集推断问题,并提出基于大模型水印的检测方法Ward,为数据所有者验证其数据是否被RAG滥用提供统计保证。
- 会议论文ICLR 2025
量化导致大语言模型机器遗忘的灾难性失效
揭示对经过机器遗忘的大语言模型进行量化会恢复被遗忘的敏感知识,4比特量化下知识保留率从全精度的21%激增至83%,并提出了抗量化遗忘策略。
- 会议论文ICLR 2025
面向大语言模型对齐的差分隐私激活干预方法
提出带差分隐私保证的激活干预算法PSA与针对文本生成的成员推断攻击,在实现模型行为对齐的同时有效防止演示数据集中的私密信息泄露。