跳到正文
10月9日 · 周五

全部论文

找到 8 篇

另有 669 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 防御arXiv 2609.38909

    Purdue 提出 Pact:将欺骗作为行为遗忘

    提出 PACT,遗忘推理模型在压力下的欺骗行为并保留上下文理解

    发表
    攻击者
    白盒
    测试
    DeepSeek-R1-Distill-Qwen-32B、QwQ-32B

    摘要论文将大模型欺骗形式化为上下文条件行为,提出 PACT 框架在消除欺骗的同时保留了上下文遵循能力。

    深度解读完整解读
  2. 防御arXiv 2609.02293

    SEAL:通过共享专家对齐强化 MoE 全局安全

    提出 SEAL,在 MoE 共享专家上做 DPO-LoRA 对齐以抵御越狱与权重篡改

    发表
    攻击者
    白盒、黑盒
    测试
    Qwen1.5-MoE-A2.7B、DeepSeekMoE-16B、GLM-4.7-Flash 等 4 个
    摘要SEAL 把 DPO-LoRA 限制在混合 MoE 共享专家上,SEAL++再保护已有安全神经元方向。

    SEAL是面向混合 MoE 的训练时防御:只对齐始终执行的共享专家,使安全不依赖路由器是否把 token 送到安全专家。

    深度解读完整解读
  3. 攻击arXiv 2609.27124

    Fed-ADR:用恶意编排服务器协同客户端梯度操纵攻击联邦学习

    提出 Fed-ADR,用编排服务器协同操纵梯度攻破联邦学习并检测恢复

    发表
    攻击者
    灰盒
    测试
    CNN(MNIST:2 Conv + 3 FC)、CNN(Fashion-MNIST:6 Conv + 1 FC)、ResNet18(CIFAR-10)
    摘要Fed-ADR 用 gray-box 编排攻击绕过多种聚合防御,再用 Hessian 一致性检测和窗口内恢复把准确率拉回。

    Fed-ADR 是一套面向联邦学习的攻击、检测与恢复框架:编排服务器改写合谋客户端的梯度,使参数服务器的现有防御把投毒更新当成良性,同时在发现后用历史梯度把全局模型原地修回来。

    深度解读完整解读
  4. 防御arXiv 2608.05045

    Gradient Immunity 提出 USG:在开放权重发布时阻断恶意微调梯度

    提出 USG,在部分保护开源权重发布时阻断有害微调梯度

    发表
    攻击者
    白盒
    测试
    Qwen3-14B(表中作 Qwen-14B)、Llama-3.1-8B(表中作 Llama-8B)
    摘要USG 在 PPOW 下用零空间立方层阻断有害微调梯度。

    Unidirectional Safety Gate 是面向 PPOW 发布设定的发布时防护:大部分权重仍可训练,一小部分安全关键组件由提供者侧加固保留,下游不必配合额外安全流程。。

    深度解读完整解读
  5. 防御arXiv 2609.39866

    研究者提出梯度封堵实现 LLM 发布前的预防性遗忘

    提出 GSU 在发布前封堵敏感门梯度,抵抗下游微调获取禁止能力

    发表
    攻击者
    白盒
    测试
    Llama-3.2-1B、Llama-3.2-3B、Llama-3.1-8B 等 7 个
    摘要GSU 在发布前封堵 SiLU 门的获取梯度,并在 TOFU 与 WMDP 上降低下游微调得分。

    Gradient-Sealed Unlearning(GSU)是一种发布前的 preemptive unlearning:不删除模型里已经有的能力,而是让指定禁止域能力更难被发布后的微调获取。

    深度解读完整解读
  6. 论文揭示 BatchNorm 架构下机器遗忘评测的归一化伪影

    诊断 BatchNorm 架构下机器遗忘评测的归一化伪影

    发表
    测试
    ResNet-18、ResNet-50、ViT-S/16 等 4 个
    摘要一次不改权重的 BN 重校准能翻转多数方法的表面遗忘,但不改变权重里的编码器泄露。

    BN illusion 是作者对近似机器遗忘评测中一种 BatchNorm 测量伪影的命名:不改权重、只用 retain 数据重算运行统计,就可以把表面遗忘准确率翻过来。

    深度解读完整解读
已经到底了