跳到正文
10月9日 · 周五

可解释性 · 论文

找到 5 篇
筛选3
同一类里任选其一,不同类之间同时满足;数字是加上其他已选条件后的篇数。另有 73 篇还没打标签,不在筛选结果里。

另有 73 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 防御arXiv 2609.34591

    TULIP:按输入定位层级的定向大模型遗忘方法

    提出 TULIP,按输入定位形成层并去除目标 token 对齐以实现定向遗忘

    发表
    测试
    Llama-3.1-8B、Llama-3.2-3B、Llama-3.2-1B 等 7 个
    摘要TULIP 在形成结束的层去掉遗忘目标对齐,多数设置下 FQ 更高,4-bit 下 FQ 下降。

    TULIP 是一种逐输入选择层的表示级遗忘方法,目标是去掉遗忘答案的形成、留下读出。输出级方法可能只压低特定回答的似然。RMU、LUNAR 等则对全部遗忘样本共用一层。

    深度解读完整解读
  2. 防御arXiv 2609.27399

    GUARD:在 CosyVoice2 上做说话人身份遗忘以阻止重识别

    提出 GUARD,在零样本 TTS 上用激活转向遗忘说话人身份以阻止再识别

    发表
    测试
    CosyVoice2-0.5B、F5-TTS、FireRedTTS
    摘要GUARD 用门控激活转向把退出说话人推向冒充相似度,以抑制再识别并保住音质。

    GUARD 用门控激活转向做说话人身份遗忘,使零样本 TTS 对退出说话人难以再识别。

    深度解读完整解读
  3. 防御arXiv 2609.31056

    SCALPEL:用对比稀疏自编码器实现选择性表征层遗忘

    提出 SCALPEL,用对比 SAE 在表征层选择性遗忘特定事实

    发表
    测试
    Qwen2.5-1.5B-Instruct、Llama-3.2-1B-Instruct、Gemma-2-2B-it
    摘要SCALPEL 以对比稀疏特征做窄目标表征遗忘,在 TOFU 上与优化基线相当且可检查。

    SCALPEL 是不改基座权重的表征层遗忘方法,面向与保留数据重叠的窄目标。

    深度解读完整解读
已经到底了