跳到正文
10月9日 · 周五

全部论文

找到 7 篇
筛选4
同一类里任选其一,不同类之间同时满足;数字是加上其他已选条件后的篇数。另有 643 篇还没打标签,不在筛选结果里。

另有 643 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 评测与基准arXiv 2610.10276

    PatchBench 提出激活补丁局部评测协议,揭示越狱修复的附带损伤

    提出 PatchBench-Local 协议,评测激活补丁修复越狱的局部附带损伤

    发表
    测试
    Qwen2.5-3B-Instruct、Qwen2.5-14B-Instruct、gemma-3-4b-it 等 8 个

    摘要论文提出 PatchBench 与局部评估协议,揭示了激活补丁在全局能力无损下仍存局部良性退化。

    深度解读完整解读
  2. 评测与基准arXiv 2609.40286

    研究者提出 COVER:在语言预算下选择源语言实现跨语言遗忘

    提出 COVER,在语言预算下选择源语言实现跨语言知识遗忘

    发表
    测试
    Tiny Aya Global、Qwen3-4B-Instruct-2507、Llama-3.2-3B-Instruct
    摘要COVER 在语言预算下选源语言,以降低未监督语言上相对 oracle 的残余访问。

    语言预算下的多语言遗忘:遗忘监督只放在 K 种源语言上,目标是降低其余语言对同一事实的残余访问,而不是把每种评测语言都译成监督数据。

    深度解读完整解读
  3. 评测与基准arXiv 2608.28233

    REINS:用 SAE 特征同时抑制有害续写并增强拒答的引导方法

    提出 REINS,在 SAE 空间抑制有害延续并增强拒答

    发表
    测试
    Qwen3.5-4B-Base、Qwen3.5-2B-Base、Gemma-3-1B-IT
    摘要REINS 分角色抑制有害延续并增强拒答。

    REINS 是一种推理时 SAE 安全转向方法,并配有用于上下文伪装的基准 GUISE。

    深度解读完整解读
  4. 评测与基准arXiv 2609.33640

    SafeMol:分子多模态模型的双模态安全对齐

    提出 SafeMol,联合对齐分子多模态模型的文本与图输入

    发表
    攻击者
    黑盒
    测试
    GPT-4o、Llama-3.2-1B-Instruct、Omni-Mol v2 等 5 个
    摘要SafeMol 用 MMD 和双分类头对齐分子多模态模型,在 Omni-Mol v2 上压低图条件攻击成功。

    SafeMol 研究分子多模态模型在危险分子相关请求上的安全对齐,并同时看过拒和任务效用。

    深度解读完整解读
  5. 评测与基准arXiv 2609.33481

    IDUnlearn-Bench:面向视觉语言模型的个体级遗忘基准

    提出 IDUnlearn-Bench,评测 VLM 个体级遗忘后的身份残留

    发表
    测试
    Qwen3-VL-2B、Qwen3-VL-4B、Qwen3-VL-8B 等 6 个
    摘要IDUnlearn-Bench 用四族探针显示:压低直接属性访问后,身份仍常能被反向查出、绑定或重构。

    IDUnlearn-Bench 评测 VLM 是否忘掉一个可跨模态识别的人,而不只是答不出某条监督事实。

    深度解读完整解读
已经到底了