防御arXiv 2610.00348
NEEDLE:通过权重正交化移除 LLM 后门
提出 NEEDLE,用权重正交化在已知触发器时去除大模型后门
- arXiv
- 2610.00348
- 发表
- 层
- 模型层
- 场景
- 模型与 API
- 测试
- Gemma-3-4B-IT、Qwen3-4B-Instruct-2507、Gemma-3-12B-IT
摘要NEEDLE 用闭式权重编辑去掉已知触发器的后门,并保住拒绝子空间。
提出 NEEDLE,用权重正交化在已知触发器时去除大模型后门
摘要NEEDLE 用闭式权重编辑去掉已知触发器的后门,并保住拒绝子空间。
用权重几何解释事后安全脆弱,并提出预训练持续安全共训练
摘要论文将后验安全脆弱性归因于正交抑制,并提出通过预训练持续共训练实现具备微调抗性的安全防护。
提出 MROP,在发射端推理时纯化输入以抵御训练投毒后门
MROP 是 deep JSCC 无线图像传输上的推理时输入纯化,对象是矩形补丁后门。
用 SAE 定位后门触发机制并分离检测与因果控制
作者用稀疏自编码器分解 Gaperon 中无害的语言切换后门,区分识别触发的特征与真正能抑制或诱发该行为的特征。固定触发使英语提示在 Gaperon-1B 与 8B 上续写成法语或德语。