跳到正文
10月9日 · 周五

可解释性 · 论文

找到 1 篇
筛选4
同一类里任选其一,不同类之间同时满足;数字是加上其他已选条件后的篇数。另有 62 篇还没打标签,不在筛选结果里。

另有 62 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 防御arXiv 2609.34591

    TULIP:按输入定位层级的定向大模型遗忘方法

    提出 TULIP,按输入定位形成层并去除目标 token 对齐以实现定向遗忘

    发表
    测试
    Llama-3.1-8B、Llama-3.2-3B、Llama-3.2-1B 等 7 个
    摘要TULIP 在形成结束的层去掉遗忘目标对齐,多数设置下 FQ 更高,4-bit 下 FQ 下降。

    TULIP 是一种逐输入选择层的表示级遗忘方法,目标是去掉遗忘答案的形成、留下读出。输出级方法可能只压低特定回答的似然。RMU、LUNAR 等则对全部遗忘样本共用一层。

    深度解读完整解读
已经到底了