防御arXiv 2609.34591
TULIP:按输入定位层级的定向大模型遗忘方法
提出 TULIP,按输入定位形成层并去除目标 token 对齐以实现定向遗忘
- arXiv
- 2609.34591
- 发表
- 场景
- 模型与 API
- 测试
- Zephyr-7B-beta、Llama-3.1-8B、Llama-3.2-3B 等 7 个
摘要TULIP 在形成结束的层去掉遗忘目标对齐,多数设置下 FQ 更高,4-bit 下 FQ 下降。
TULIP 是一种逐输入选择层的表示级遗忘方法,目标是去掉遗忘答案的形成、留下读出。输出级方法可能只压低特定回答的似然。RMU、LUNAR 等则对全部遗忘样本共用一层。