防御arXiv 2609.32602
AnchorRep:用表征排斥防御 LLM 跨模型对抗迁移攻击
提出 AnchorRep,用 LoRA 推离有害提示表征以防御跨模型越狱迁移
- arXiv
- 2609.32602
- 发表
- 层
- 模型层
- 场景
- 模型与 API
- 攻击者
- 无盒(离线迁移)
- 被测模型
- Llama-3-8B、Mistral-7B、Vicuna-7B 等 5 个
提出 AnchorRep,用 LoRA 推离有害提示表征以防御跨模型越狱迁移
提出 AEGIS,用中层内部信号选择性激活后层适配器拦截音频越狱
提出 RAPID,离线把抗蒸馏扰动写入文生图解码器
提出 Safin-1,以可路由 Safety State 在冻结主干上实现内在安全
提出 CodeSpear 越狱,借语法约束解码生成恶意代码,并给出 CodeShield 防御
摘要论文发现语法约束解码会破坏自然语言安全对齐,提出 CodeSpear 越狱攻击与基于蜜罐代码对齐的 CodeShield 防御。
提出 Staged Decoding 与指令跟随训练,减少推理轨迹隐私泄露
本文把大推理模型的隐私问题做成轨迹可控性:隐私指令是指令,轨迹不跟随就会把敏感上下文写进可被提示注入导出的文本。