全部动态
从来源,看到研究的联系
点击节点查看内容
本页材料
24 条- 会议论文ICLR 2026
镜头下的开盒:揭示多模态大推理模型的位置隐私泄露
揭示了攻击者可利用多模态大推理模型从用户自拍等日常图片中精准推断家庭住址等敏感地理位置隐私,并提出DoxBench数据集与两阶段攻击框架。
- 会议论文ICLR 2026
ReTrace:基于强化学习的机器遗忘数据重构攻击
该研究提出ReTrace攻击框架,将遗忘数据恢复建模为强化学习问题,利用模型残留遗忘痕迹引导生成器有效重构出已被删除的图像与文本隐私样本。
- 会议论文ICLR 2026
Hot PATE:面向多样化生成任务的分布隐私聚合
针对文本生成等多输出多样性任务中PATE协议的效用冲突,提出Hot PATE采样器,在仅需API访问下无需额外隐私代价即可有效保留生成多样性。
- 会议论文ICLR 2026
消除还是隐藏?抑制虚假遗忘神经元以实现鲁棒机器遗忘
揭示了现有大模型遗忘方法常通过虚假神经元隐藏敏感知识而非彻底消除的问题,提出基于归因正则化的Ssiuu方法,有效防止再训练时遗忘知识复现,保障隐私安全。
- 会议论文ICLR 2026
无声泄露:针对RAG系统的隐式知识提取攻击
提出隐式知识提取攻击IKEA,无需越狱或提示注入即可通过良性查询高效窃取RAG外部知识库,揭示了严重的隐私与侵权泄露风险。
- 会议论文ICML 2026
非对称数据源下的机器遗忘:利用公开数据改善效用权衡
提出非对称朗之万遗忘框架ALU,通过引入公开数据降低遗忘隐私成本并抵御成员推断攻击,在大规模删除下兼顾模型效用。
- 会议论文ICML 2026
通过降低数据归因实现大语言模型机器遗忘
提出首个基于数据归因奖励的LLM遗忘框架DareU,利用强化学习降低生成回答对遗忘数据的归因分数,在遗忘质量与模型可用性间取得更优平衡。
- 会议论文ICML 2026
基于文本保持技术的微调大语言模型数据溯源审计
该研究提出一种利用不可见Unicode字符构建线索-回复对的水印方法,可在黑盒环境下以统计保证审计敏感或版权文本是否被用于微调LLM,实现低误报高召回。
- 会议论文ICML 2026
基于偏好校准优化与得分级分布对齐的文生图扩散模型遗忘学习
提出POSDA遗忘学习框架,将扩散模型遗忘重构为偏好优化并引入得分级分布对齐,在物体、风格及NSFW擦除任务中实现了高效擦除且保持了模型效用。
- 会议论文ICML 2026
从开源模型中提取对齐数据
用嵌入模型衡量,发现后训练模型会大量复述 SFT/RL 阶段的对齐数据,字符串匹配至少低估约 10 倍,这些数据可用于训练基座模型。
- 会议论文ICML 2026
OptiFluence:隐私金丝雀的原则性设计
针对机器学习隐私审计中金丝雀样本设计的启发式局限,提出双层优化框架OptiFluence,利用影响函数设计高可检测性金丝雀,实现跨模型架构的隐私审计。
- 会议论文ICML 2026
基于SGD稳定性的轨迹感知可证明去中心化遗忘
针对去中心化遗忘对静态超参数和凸性假设的依赖,该研究提出TRACE-DU框架,通过局部SGD敏感度分析与校准噪声扰动,实现了高效且具理论保证的可证明遗忘。
- 会议论文ICML 2026
SlaClip:以梯度范数 slack 作为 DP-SGD 自适应裁剪的指示信号
利用裁剪操作产生的 slack 信息自适应调整裁剪阈值,不增加额外隐私查询,在多数据集上优于已有自适应裁剪方法。
- 会议论文ICML 2026
协作式阈值水印
联邦学习中提出 (t,K) 阈值水印,密钥秘密共享,至少 t 个客户端联合才能验证模型归属,在 K=128 时仍可检测且精度损失很小。
- 会议论文ICML 2026
先调温后倾斜:基于温度调节与分类器引导的生成模型机器遗忘
提出T3-Unlearning框架,在冻结基座模型的前提下通过平滑尖峰分布与分类器倾斜引导两步推理,在TOFU基准上提升了遗忘质量。
- 会议论文ICML 2026
部分模型合并对模型克隆攻击的抵抗力实证研究
提出模型克隆攻击,在八种先验知识场景下重建部分合并模型的私有部分;仅泄露少量数据、参数或结构即可恢复大部分性能。
- 会议论文ICML 2026
扩散模型中的机器遗忘:基于KL散度与似然约束的统一框架
提出基于KL散度与似然约束的优化框架,将扩散模型中的概念与数据遗忘转化为带约束优化问题,改善了遗忘与保留效用的权衡。
- 会议论文ICML 2026
超越样本级遗忘:提升多模态机器遗忘的可靠性
提出解耦知识组件的多模态机器遗忘框架,结合变分推断与对比语义编辑实现细粒度遗忘,在隐私与版权敏感场景下兼顾遗忘有效性、可靠性与局部性。
- 会议论文ICML 2026
面向未见类别的成员推断攻击
提出“未见类别”数据审计设定,发现主流成员推断攻击失效,而分位数回归攻击 TPR 最高达影子模型方法的 11 倍。
- 会议论文ICML 2026
基于差分隐私的隐私且稳定测试时自适应
将多种TTA方法转化为差分隐私形式以控制测试数据隐私风险,在仅付出微小精度代价的情况下保护隐私并提升适应稳定性。
- 会议论文ICML 2026
用于大语言模型对齐的差分隐私偏好数据合成
提出DPPrefSyn算法生成具差分隐私保证的合成偏好数据,在保护敏感人类提示和判断隐私的同时实现具竞争力的模型对齐。
- 会议论文ICML 2026
表征遗忘:通过信息压缩实现机器遗忘
针对参数修改式遗忘不稳定且开销大的问题,该研究提出表征遗忘框架,在表征空间施加信息瓶颈以最大化保留有用信息并消除遗忘数据信息,实现高效可靠的遗忘。
- 会议论文ICML 2026
PrivCode++:提供全面隐私保障的隐空间条件差分隐私代码生成
提出差分隐私代码生成框架PrivCode++,通过无隐私潜在条件模块,在微调中同时保护提示词与代码免受大模型记忆与隐私泄露。
- 会议论文ICML 2026
ASRU:结合激活引导与强化遗忘的多模态大模型机器遗忘
针对多模态大语言模型记忆敏感信息的问题,提出ASRU框架,通过激活重定向引导拒答并用强化学习优化拒答边界,兼顾敏感知识遗忘与生成质量。