防御arXiv 2609.32602
AnchorRep:用表征排斥防御 LLM 跨模型对抗迁移攻击
提出 AnchorRep,用 LoRA 推离有害提示表征以防御跨模型越狱迁移
- arXiv
- 2609.32602
- 发表
- 层
- 模型层
- 场景
- 模型与 API
- 攻击者
- 无盒(离线迁移)
- 被测模型
- Llama-3-8B、Mistral-7B、Vicuna-7B 等 5 个
另有 193 篇论文还没打上分类标签,暂不在筛选结果里。
提出 AnchorRep,用 LoRA 推离有害提示表征以防御跨模型越狱迁移