全部动态
从来源,看到研究的联系
点选节点,展开一条线索
本页材料
完整标题与摘要 · 24 条- 会议论文ACL 2025
隐私记忆编辑:将模型记忆转化为数据隐私防御
提出PME,检测并编辑模型记住的个人身份信息,在不影响基础语言模型的同时减少训练数据提取泄露,部分配置下攻击准确率降至零。
- 会议论文ACL 2025
当GPT泄密:GPTs知识文件泄露的全面评估
系统识别GPTs知识文件的五类泄露途径,其中代码解释器引入的权限提升漏洞可使攻击者直接下载原始文件,成功率达95.95%。
- 会议论文ACL 2025
DYNTEXT:面向隐私保护 LLM 推理的语义感知动态文本脱敏
基于本地差分隐私,按语义密度动态构建敏感词邻接表并替换,在隐私与效用间取得更好平衡,三个数据集上优于强基线。
- 会议论文ACL 2025
CLEAR:文本与视觉模态下的角色遗忘基准
提出首个开源多模态遗忘基准,含 200 个虚构人物和 3700 张图像,评测 11 种方法,发现联合遗忘两种模态优于单模态遗忘。
- 会议论文ACL 2025
学习用 token、遗忘用 token:以双目的训练缓解 LLM 的成员推断攻击
提出 DuoLearn,按 token 特性区分需学习的难 token 与需遗忘的已记忆 token,在训练阶段防御成员推断攻击,同时让语言建模性能提升约 10%。
- 会议论文ACL 2025
哪些保留集影响大模型遗忘?实体遗忘案例研究
发现句法相似查询在实体遗忘中性能损失最大,将其用于正则化可保护这类查询,并维持或改善其他子集表现。
- 会议论文ACL 2025
MMUnlearner:重新定义多模态大模型的机器遗忘
提出几何约束梯度上升方法,删除实体相关视觉模式并保留文本知识,在全部评估维度上优于所比较的遗忘基线。
- 会议论文ACL 2025
基于采样伪似然的成员推断攻击
提出 SaMIA,仅用 LLM 生成文本的 n-gram 匹配度计算伪似然来判断文本是否在训练集中,无需 likelihood 即可媲美现有方法,可用于闭源模型。
- 会议论文ACL 2025
合并陌生 LLM 需谨慎:可窃取隐私的钓鱼模型
提出 PhiMM 攻击:训练伪装成专用能力的钓鱼模型,受害者合并后可提取 PII 与成员信息,平均 PII 泄露增加 3.9%、成员推断泄露增加 17.4%。
- 会议论文ACL 2025
解耦记忆、静音神经元:面向 LLM 的实用机器遗忘
提出 NeuMuter,仅调制约 1% 的 FFN 神经元输出来遗忘指定数据,在四个 LLM 上有效遗忘并保持下游任务性能。
- 会议论文ACL 2025
RecordTwin:构建安全的合成临床语料
从匿名化临床实体出发,用 LLM 补全上下文生成合成语料,仅需少量原始文档;实验显示效用接近原数据,且隐私安全性优于基线。
- 会议论文ACL 2025
REVS:通过词表空间秩编辑遗忘语言模型中的敏感信息
提出非梯度方法 REVS,修改少量与敏感信息相关的神经元来遗忘邮箱、SSN 等 PII,在抗提取攻击上优于其他方法并保持模型完整性。
- 会议论文ACL 2025
DPGA-TextSyn:用于合成文本生成的差分隐私遗传算法
结合通用 LLM 与遗传算法,在差分隐私约束下生成相关且多样的合成文本,在保证隐私的同时显著提升下游任务表现。
- 会议论文ACL 2025
R.R.:通过回忆与排序揭示 LLM 训练隐私
提出两步隐私窃取攻击:先让 LLM 回忆并填补被掩码的文本以提取 PII 候选,再用参考模型校准排序;即便训练数据已清洗仍可重建 PII。
- 会议论文ACL 2025
增强基于微调的 LLM 遗忘学习的通用框架
提出 GRUN,用软门控区分目标数据并通过 ReFT 调整表示来抑制生成,在移除版权和隐私数据的同时显著提升遗忘效果与模型效用。
- 会议论文ACM CCS 2025
Split Unlearning:拆分学习中的机器遗忘
- 会议论文ACM CCS 2025
匿名性揭秘:审计深度学习模型数据使用的实用框架
- 会议论文ACM CCS 2025
TensorShield:用 TEE 保护关键 DNN 张量以守护端侧推理
- 会议论文ACM CCS 2025
作为隐私工具的成员推断攻击:可靠性、差异性与集成
- 会议论文ACM CCS 2025
针对分布式大语言模型推理框架的 Prompt 推断攻击
- 会议论文ACM CCS 2025
Prototype Surgery:通过软标签调整神经原型以实现高效机器遗忘
- 会议论文ACM CCS 2025
Riddle Me This!针对检索增强生成的隐蔽成员推断
- 会议论文ACM CCS 2025
基于差分的微调大模型专有数据提取
- 会议论文ACM CCS 2025
DivTrackee 对 DynTracker:面向动态人脸识别策略的多样化反人脸识别