防御arXiv 2610.00685
研究者提出用零空间投影净化 LoRA 微调 LLM 的后门
用零空间投影净化 LoRA 微调模型后门并保留基座与下游能力
- arXiv
- 2610.00685
- 发表
- 场景
- 模型与 API
- 测试
- Mistral-7B-Instruct-0.1、LLaMA2-7B-Chat、LLaMA2-13B-Chat 等 6 个
用零空间投影净化 LoRA 微调模型后门并保留基座与下游能力
提出 SEAL,在 MoE 共享专家上做 DPO-LoRA 对齐以抵御越狱与权重篡改
SEAL是面向混合 MoE 的训练时防御:只对齐始终执行的共享专家,使安全不依赖路由器是否把 token 送到安全专家。
用权重几何解释事后安全脆弱,并提出预训练持续安全共训练
摘要论文将后验安全脆弱性归因于正交抑制,并提出通过预训练持续共训练实现具备微调抗性的安全防护。