防御arXiv 2610.00348
NEEDLE:通过权重正交化移除 LLM 后门
提出 NEEDLE,用权重正交化在已知触发器时去除大模型后门
- arXiv
- 2610.00348
- 发表
- 层
- 模型层
- 场景
- 模型与 API
- 被测模型
- Gemma-3-4B-IT、Qwen3-4B-Instruct-2507、Gemma-3-12B-IT
摘要NEEDLE 用闭式权重编辑去掉已知触发器的后门,并保住拒绝子空间。
提出 NEEDLE,用权重正交化在已知触发器时去除大模型后门
摘要NEEDLE 用闭式权重编辑去掉已知触发器的后门,并保住拒绝子空间。
提出 ODPure,在输入阶段用腐蚀重建与共识净化目标检测后门
解释后验安全的权重几何脆弱性,并提出预训练持续安全共训练
摘要论文将后验安全脆弱性归因于正交抑制,并提出通过预训练持续共训练实现具备微调抗性的安全防护。
提出 TRIM,在黑盒推理时定位并净化图像后门区域
提出 TC-UAP,用身份级多帧扰动保护视频免被定制复现身份
作者要解决的是:发布前如何给视频加不可见扰动,使片段既不能被拿去微调视频扩散模型,也不能被抽帧做 image-to-video。
提出多轮在线骚扰 Agent 基准,评测记忆、规划与微调越狱