跳到正文
10月9日 · 周五

全部论文

找到 3 篇
筛选3
同一类里任选其一,不同类之间同时满足;数字是加上其他已选条件后的篇数。另有 592 篇还没打标签,不在筛选结果里。

另有 592 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 防御arXiv 2609.38909

    Purdue 提出 Pact:将欺骗作为行为遗忘

    提出 PACT,遗忘推理模型在压力下的欺骗行为并保留上下文理解

    发表
    攻击者
    白盒
    测试
    DeepSeek-R1-Distill-Qwen-32B、QwQ-32B

    摘要论文将大模型欺骗形式化为上下文条件行为,提出 PACT 框架在消除欺骗的同时保留了上下文遵循能力。

    深度解读完整解读
  2. 攻击arXiv 2610.05894

    研究者提出闭环偏见注入攻击

    提出闭环激活引导,在扩散语言模型去噪过程中注入定向偏见

    发表
    攻击者
    灰盒
    测试
    LLaDA-8B-Instruct、Dream-v0-Instruct-7B、LLaDA-MoE-7B-A1B-Instruct

    摘要通过去噪中间概率反馈动态调节残差流转向,证明扩散语言模型在推理服务栈中存在闭环偏见注入脆弱性。

    深度解读完整解读
  3. 防御arXiv 2609.39866

    研究者提出梯度封堵实现 LLM 发布前的预防性遗忘

    提出 GSU 在发布前封堵敏感门梯度,抵抗下游微调获取禁止能力

    发表
    攻击者
    白盒
    测试
    Llama-3.2-1B、Llama-3.2-3B、Llama-3.1-8B 等 7 个
    摘要GSU 在发布前封堵 SiLU 门的获取梯度,并在 TOFU 与 WMDP 上降低下游微调得分。

    Gradient-Sealed Unlearning(GSU)是一种发布前的 preemptive unlearning:不删除模型里已经有的能力,而是让指定禁止域能力更难被发布后的微调获取。

    深度解读完整解读
已经到底了