全部动态
从来源,看到研究的联系
点选节点,展开一条线索
本页材料
完整标题与摘要 · 24 条- 会议论文ICML 2026
MemPot:利用优化蜜罐防御记忆提取攻击
提出面向LLM智能体的防御框架MemPot,通过在记忆系统中注入优化蜜罐诱捕攻击者,在零在线推理延迟下有效防御记忆提取攻击。
- 会议论文ICML 2026
通过正则化实现隐私机器学习的高效公开验证
针对差分隐私机器学习模型难以低成本验证的问题,提出首个验证开销显著低于训练成本的差分隐私随机凸优化算法,实现高效公开验证。
- 会议论文ICML 2026
Privasis:从零合成最大规模的“公开”隐私数据集
构建包含140万条记录的大规模合成隐私文本数据集Privasis,用于训练针对敏感属性的文本脱敏模型,性能超越GPT-5等前沿大模型。
- 会议论文ICML 2026
在保持可用性的同时可证明防御微调大模型的训练数据提取
提出基于相对概率平滑低影响token的防御算法SCP-Delta_r,在提供更优理论隐私界的同时有效防御训练数据提取攻击,且几乎不损失效用。
- 会议论文ICML 2026
重新审视针对图神经网络的黑盒链接窃取攻击不对称性
在严格黑盒设定下研究针对GNN的后验链接窃取攻击,提出几何感知重调方法提升类内窃取成功率,揭示了后验隐私泄露风险被低估的问题。
- 会议论文ICML 2026
PrivGate:基于潜空间几何调控大语言模型的语境完整性
发现大模型残差流中线性编码隐私敏感性的流形结构,提出无需微调的PrivGate框架,在检测到高隐私风险时触发显式推理,降低62.6%的智能体隐私泄露。
- 会议论文ICML 2026
隐秘风险:基于模态不平衡的多模态联邦学习成员推断攻击
首次系统研究多模态联邦学习的成员推断攻击,揭示模态不平衡带来的新攻击面,并提出自适应选择模态的感知攻击框架。
- 会议论文ICML 2026
私有且鲁棒对齐的改进界
从理论上分析偏好标签受隐私约束和对抗性污染时语言模型对齐的次优性上界,覆盖离线与在线设置。
- 会议论文ICML 2026
贝叶斯采样如何助力成员推断攻击?
提出基于贝叶斯采样的成员推断攻击BMIA,通过拉普拉斯近似单参考模型后验以减少模型内方差,以更低计算开销在图像、文本和表格数据上达到SOTA效果。
- 会议论文ICML 2026
MINIM:基于可信本地脱敏的智能体隐私感知最小化视图
针对自主智能体传输完整UI可能泄露验证码等敏感信息的问题,提出本地代理MINIM,基于语境完整性对UI元素进行敏感度与必要性评分和脱敏,有效减少数据泄露。
- 会议论文ICML 2026
逆向工程语言模型的模型编辑:揭示更新隐蔽泄露与防御
揭示模型编辑参数更新会作为侧信道泄露编辑数据,提出逆向恢复攻击KSTER及通过语义诱饵混淆指纹的子空间伪装防御策略。
- 会议论文ICML 2026
Leak@k:概率解码下遗忘学习并未让 LLM 真正忘记
提出 leak@k 指标,发现几乎所有 unlearning 方法在采样解码下敏感信息仍会重现,并提出 RULE 算法缓解。
- 会议论文ICML 2026
遗忘并非消除:揭示类别遗忘评估中的隐藏泄露与防御
提出类别成员推断攻击CMIA,揭示遗忘评估因忽略类别几何而导致隐私泄露,并提出微调目标TREW缓解该泄露。
- 会议论文ICML 2026
ACTG-ARL:基于强化学习增强控制的差分隐私条件文本生成
提出ACTG-ARL框架,通过属性条件生成与锚定强化学习,在强差分隐私保证下生成高质量合成文本,保护语言模型训练中的用户隐私。
- 会议论文ICML 2026
ZeroUnlearn:大语言模型中的少样本知识遗忘
提出少样本遗忘框架ZeroUnlearn,通过模型编辑将敏感输入映射至中性状态并消除原始表征,高效消除有害生成与隐私记忆。
- 会议论文ICML 2026
遗忘以知,记忆以用:面向大语言模型的上下文感知遗忘学习
发现六种 SOTA unlearning 方法会削弱模型对上下文中重新给出信息的使用能力,提出即插即用的损失项恢复该能力,同时保持遗忘效果。
- 会议论文ICML 2026
面向异构RAG知识库的全语料重构提取攻击
揭示了检索增强生成系统底层语料可被提取的隐私风险,提出GeoEx框架,通过在嵌入空间规划与几何查询合成,实现了对异构知识库的高覆盖全语料重构。
- 会议论文ICML 2026
遗忘与保留的两难:持续学习中的认证遗忘理论
首次建立持续学习与机器遗忘的理论联系,将遗忘目标表述为遗忘后超额风险最小化,并比较梯度法与 Hessian 法,提出降低存储开销的混合策略。
- 会议论文NDSS 2026
基于蒸馏与贡献感知聚合的联邦学习成员推断统一防御框架
结合熵正则教师训练、CVAE 合成数据蒸馏和贡献感知聚合,同时防御被动与主动成员推断攻击,并保持模型精度。
- 会议论文NDSS 2026
面向大域分类与键值数据的增强型洗牌差分隐私协议
提出FME协议,通过哈希过滤、多重加密和虚拟数据提升大域分类及键值统计中的隐私、鲁棒性与效率。
- 会议论文NDSS 2026
级联式与代理式成员推断攻击
提出CMIA和PMIA两种成员推断攻击,利用样本依赖与代理样本提升低误报场景下的隐私风险评估效果。
- 会议论文NDSS 2026
CELLSHIFT:面向真实网站指纹识别的RTT感知轨迹转换
提出将Tor出口轨迹转换为入口视角的方法,帮助更准确评估网站指纹识别对用户隐私的风险。
- 会议论文NDSS 2026
通过收缩式消息传递实现多层 GNN 的收敛隐私框架
证明利用 GNN 的收缩性质,隐私预算随层数收敛而非线性增长,提出 CARIBOU 框架,改善隐私-效用权衡并支持隐私审计。
- 会议论文NDSS 2026
CRISP:抵御恶意客户端的高效 ML 推理密码学框架
基于 Function Secret Sharing 与 CKKS 复数域验证,防止恶意客户端窃取模型参数,推理通信开销最多降低 94%、延迟降低 43%。