防御arXiv 2609.39279
FDCU:用双重约束子空间投影抵御机器遗忘后的重训练攻击
提出 FDCU 双约束子空间投影遗忘,抵御再训练恢复有害知识
- arXiv
- 2609.39279
- 发表
- 场景
- 模型与 API
- 测试
- Qwen2.5-3B、Llama-3-8B-Instruct、Qwen-3-8B
摘要FDCU 用双掩码限制浅层抑制,在知识擦除与安全输出上提高再训练后的稳定性。
FDCU 是一种约束参数更新的遗忘方法,用来降低再训练把已抑制恶意行为重新引出的可能。
提出 FDCU 双约束子空间投影遗忘,抵御再训练恢复有害知识
FDCU 是一种约束参数更新的遗忘方法,用来降低再训练把已抑制恶意行为重新引出的可能。
测绘去安全开源模型的生产与重分发留存链路
摘要论文测绘了去安全开源大模型供应链,作者指出高集中度的重分发层赋能模型持久留存与部署扩散。
提出 SEAL,在 MoE 共享专家上做 DPO-LoRA 对齐以抵御越狱与权重篡改
SEAL是面向混合 MoE 的训练时防御:只对齐始终执行的共享专家,使安全不依赖路由器是否把 token 送到安全专家。
提出 USG,在部分保护开源权重发布时阻断有害微调梯度
Unidirectional Safety Gate 是面向 PPOW 发布设定的发布时防护:大部分权重仍可训练,一小部分安全关键组件由提供者侧加固保留,下游不必配合额外安全流程。。
提出 GSU 在发布前封堵敏感门梯度,抵抗下游微调获取禁止能力
Gradient-Sealed Unlearning(GSU)是一种发布前的 preemptive unlearning:不删除模型里已经有的能力,而是让指定禁止域能力更难被发布后的微调获取。
提出跨架构攻击 CSR,用概念分数参数重学习恢复文生图被擦除概念