防御arXiv 2610.00685
研究者提出用零空间投影净化 LoRA 微调 LLM 的后门
用零空间投影净化 LoRA 微调模型后门并保留基座与下游能力
- arXiv
- 2610.00685
- 发表
- 场景
- 模型与 API
- 测试
- Mistral-7B-Instruct-0.1、LLaMA2-7B-Chat、LLaMA2-13B-Chat 等 6 个
用零空间投影净化 LoRA 微调模型后门并保留基座与下游能力
测绘去安全开源模型的生产与重分发留存链路
摘要论文测绘了去安全开源大模型供应链,作者指出高集中度的重分发层赋能模型持久留存与部署扩散。
提出 SYNCHAIN,诱导计算机使用 Agent 自合成潜伏技能并跨任务触发
摘要论文揭示了 CUA 自合成工件带来的内部供应链威胁,验证了潜伏载荷的跨任务传播能力与防御局限。
提出参考嫁接,在推理阶段用激活干预诱导沙袋隐藏能力
摘要提出参考嫁接在推理阶段以低成本匹配微调诱导效果,揭示隐瞒表征重叠与阈值门控机制。