防御arXiv 2610.00685·10月2日研究者提出用零空间投影净化 LoRA 微调 LLM 的后门用零空间投影净化 LoRA 微调模型后门并保留基座与下游能力arXiv2610.00685发表10月2日层训练与数据层场景模型与 API测试LLaMA2-7B-Chat、LLaMA2-13B-Chat、Qwen2-7B-Instruct 等 6 个防御模型加固攻击投毒与后门组件微调与开源权重深度解读完整解读