防御arXiv 2610.00685
研究者提出用零空间投影净化 LoRA 微调 LLM 的后门
用零空间投影净化 LoRA 微调模型后门并保留基座与下游能力
- arXiv
- 2610.00685
- 发表
- 场景
- 模型与 API
- 测试
- LLaMA2-7B-Chat、LLaMA2-13B-Chat、Qwen2-7B-Instruct 等 6 个
用零空间投影净化 LoRA 微调模型后门并保留基座与下游能力
提出 AGENTQ,向开源智能体权重植入仅在量化后触发的恶意工具后门
摘要论文研究了智能体量化条件后门风险,提出 AGENTQ 在保持效用的同时实现全精度隐蔽与量化后生效。