全部动态
从来源,看到研究的联系
点选节点,展开一条线索
本页材料
完整标题与摘要 · 24 条- 会议论文ICLR 2025
大语言模型输出语义敏感信息的基准评测
针对简单自然提问诱导模型泄露语义敏感信息(SemSI)的问题,构建包含三类敏感信息的数据集SemSI-Set与基准SemSI-Bench,系统评测揭示该隐患在主流模型中普遍存在。
- 会议论文ICLR 2025
通过明亮末端注意力探索扩散模型中的局部记忆
针对文生图扩散模型复现训练数据的局部记忆问题,发现记忆图像块在最后一步高度关注末尾Token的异常模式,实现了局部记忆区域的高效定位与有效缓解。
- 会议论文ICLR 2025
ScaleGUN:可扩展且可证明的图遗忘学习
为保护GNN中的用户隐私,提出首个可扩展至十亿级边图的可证明图遗忘方法ScaleGUN,在提供差分隐私保证的同时大幅提升遗忘效率。
- 会议论文ICLR 2025
对加密友好的 LLM 架构
提出适配同态加密的 Transformer 架构,结合 LoRA 与高斯核,微调加速 6.94 倍、推理加速 2.3 倍,性能接近明文模型,用于隐私保护的 LLM 服务。
- 会议论文ICLR 2025
上下文学习中基于数据自适应差分隐私的提示合成
提出差分隐私算法AdaDPSyn,通过自适应加噪从私有数据集中合成示例用于上下文学习,在提供形式化差分隐私保证的同时防止大模型泄露提示中的私有信息。
- 会议论文ICLR 2025
对抗性机器遗忘学习
将机器遗忘建模为抵御成员推断攻击(MIA)的斯塔克伯格博弈,主动将审计者的攻击结合进遗忘算法设计中,通过隐式微分限制攻击成功率以消除训练数据影响。
- 会议论文ICLR 2025
从已对齐的商用语言模型中大规模提取训练数据
提出了两种新型攻击方法,能突破模型对齐护栏并从ChatGPT等主流商用对齐模型中恢复出数千条记忆的训练数据,揭示了数据泄露风险。
- 会议论文ICLR 2025
基于反演推理扰动的图像级模型记忆检测
提出IIP框架,利用DDIM反演与提示嵌入扰动,在无原始提示词下有效检测扩散模型是否记忆了特定私有图像。
- 会议论文ICLR 2025
面向大语言模型遗忘学习方法的有效评估与比较
针对现有遗忘评估指标易受红队攻击且难以权衡遗忘与保留的问题,提出鲁棒评估指标与校准方法,以准确评估并提升大模型消除有害数据记忆的效果。
- 会议论文ICLR 2025
隐藏状态威胁模型下DP-SGD更紧致的隐私审计
针对仅能访问最终模型的隐藏状态威胁模型,提出通过构造对抗梯度序列最大化隐私损失的审计方法,大幅缩小了DP-SGD经验审计下界与理论上界的差距。
- 会议论文ICLR 2025
面向大语言模型的统一参数高效遗忘学习
提出基于影响函数的实例级遗忘框架LLMEraser,通过精确调整参数消除敏感或不良信息,在不损害模型整体性能的前提下高效处理多种遗忘任务。
- 会议论文ICML 2025
利用逐样本隐私损失进行机器遗忘
用逐样本隐私损失替代最坏情况界,量化微调式遗忘的难度,改进效用与遗忘的权衡,并与数据难度指标相关联。
- 会议论文ICML 2025
别模仿我的声音:零样本 TTS 的说话人身份遗忘
首次为零样本语音合成提出机器遗忘框架 TGU,使模型不再复现指定说话人声音,同时保持其他说话人的合成质量。
- 会议论文ICML 2025
利用模型与数据划分中的随机性实现隐私放大
研究数据划分和模型划分中的训练随机性如何带来隐私放大,并提出 balanced iteration subsampling,在某些情形下比 Poisson 采样隐私放大更强。
- 会议论文ICML 2025
神经网络的可证明遗忘
利用遗忘与随机后处理隐私放大的联系,通过在保留数据上加噪微调实现无损失函数假设的可证明机器遗忘。
- 会议论文ICML 2025
二元响应模型的差分隐私分析:最优性、估计与推断
在 LabelDP 约束下通过最大化 Fisher 信息矩阵的迹优化随机响应机制,实现二元响应模型的最优估计,并给出覆盖率达标的私有置信区间。
- 会议论文ICML 2025
针对图像自回归模型的隐私攻击
对 IAR 做隐私分析,新成员推断攻击在 1% FPR 下 TPR 达 86.38%,数据集推断仅需 6 个样本,并能提取数百张训练图像,远比扩散模型脆弱。
- 会议论文ICML 2025
这也是我的数据:多用户训练样本数据集的隐私机器学习
研究单个样本归属多个用户时的用户级差分隐私训练,给出定义、贡献界定的贪心基线算法,并分析其偏差-方差权衡。
- 会议论文ICML 2025
无需源数据的可认证遗忘方法
提出用近似源数据分布的替代数据集实现可认证机器遗忘,按两者统计距离校准噪声,在无原始训练数据时仍给出隐私保证。
- 会议论文ICML 2025
错误未必不好:用对抗样本做机器遗忘
提出 AMUN,在遗忘样本对应的对抗样本上微调以降低置信度;遗忘 CIFAR-10 的 10% 样本后,SOTA 成员推断攻击也不优于随机猜测。
- 会议论文ICML 2025
客户端协作:效用-隐私权衡有保证提升的灵活差分隐私联邦学习
提出 FedCEO,在服务器端对堆叠的本地模型参数做张量低秩近似以恢复被噪声破坏的语义,将效用-隐私权衡界改进 √d 倍。
- 会议论文ICML 2025
差分隐私语言模型的 Scaling Laws
建立能刻画 DP LLM 训练特性的 scaling laws,给出计算、隐私与效用的整体关系及多种设置下的最优训练配置。
- 会议论文ICML 2025
系统感知的遗忘算法:存得更少,忘得更快
提出 system-aware unlearning 定义,仅针对只能获取系统所存数据的攻击者提供遗忘保证,并给出线性分类的精确遗忘算法及权衡分析。
- 会议论文ICML 2025
连接 Thompson Sampling 与 UCB:更高效的隐私与遗憾权衡
提出 DP-TS-UCB,在差分隐私随机 bandit 中以参数 α 权衡隐私与遗憾,给出 GDP 保证与遗憾上界。