全部动态
从来源,看到研究的联系
图中 4 条 · 本页 4 条 · 共 316 条动态论文会议论文
关系图可左右滑动,完整标题也在下方列表中
流带宽度表示材料数量,多标签均分;连线表示来源与分类归属。
点选节点,展开一条线索
本页材料
完整标题与摘要 · 4 条- 会议论文NeurIPS 2025
蒸馏使遗忘更稳健
发现少量微调即可恢复被遗忘能力,提出 UNDO 将遗忘后的模型蒸馏到加噪副本,在 WMDP 上实现更稳健的能力移除。
- 会议论文NeurIPS 2025
逐点防御 LLM 微调 API 的根本局限
证明检测单个有害样本的逐点防御存在根本局限,用全为良性样本的攻击在 OpenAI 微调 API 上套取有害知识,并绕过增强监控。
- 会议论文NeurIPS 2025
从休眠到删除:基于权重空间正则化的抗篡改遗忘
发现遗忘方法易受再学习攻击,仅在保留集上微调即可恢复遗忘知识;据权重空间性质提出新方法,提升抗再学习攻击能力。
- 会议论文NeurIPS 2025
过拟合攻击:仅用 10 条良性样本微调即可越狱 LLM
先用相同拒答的良性样本使模型过拟合,再用普通良性回答微调使其遗忘拒答,在十个 LLM 上攻击效果与隐蔽性均优于五个基线。