防御arXiv 2609.39279
FDCU:用双重约束子空间投影抵御机器遗忘后的重训练攻击
提出 FDCU 双约束子空间投影遗忘,抵御再训练恢复有害知识
- arXiv
- 2609.39279
- 发表
- 场景
- 模型与 API
- 测试
- Qwen2.5-3B、Llama-3-8B-Instruct、Qwen-3-8B
摘要FDCU 用双掩码限制浅层抑制,在知识擦除与安全输出上提高再训练后的稳定性。
FDCU 是一种约束参数更新的遗忘方法,用来降低再训练把已抑制恶意行为重新引出的可能。
提出 FDCU 双约束子空间投影遗忘,抵御再训练恢复有害知识
FDCU 是一种约束参数更新的遗忘方法,用来降低再训练把已抑制恶意行为重新引出的可能。
提出 SEAL,在 MoE 共享专家上做 DPO-LoRA 对齐以抵御越狱与权重篡改
SEAL是面向混合 MoE 的训练时防御:只对齐始终执行的共享专家,使安全不依赖路由器是否把 token 送到安全专家。
提出 USG,在部分保护开源权重发布时阻断有害微调梯度
Unidirectional Safety Gate 是面向 PPOW 发布设定的发布时防护:大部分权重仍可训练,一小部分安全关键组件由提供者侧加固保留,下游不必配合额外安全流程。。
提出跨架构攻击 CSR,用概念分数参数重学习恢复文生图被擦除概念