防御arXiv 2609.32602
AnchorRep:用表征排斥防御 LLM 跨模型对抗迁移攻击
提出 AnchorRep,用 LoRA 推离有害提示表征以防御跨模型越狱迁移
- arXiv
- 2609.32602
- 发表
- 层
- 模型层
- 场景
- 模型与 API
- 攻击者
- 无盒(离线迁移)
- 被测模型
- Llama-3-8B、Mistral-7B、Vicuna-7B 等 5 个
另有 240 篇论文还没打上分类标签,暂不在筛选结果里。
提出 AnchorRep,用 LoRA 推离有害提示表征以防御跨模型越狱迁移
提出 Prometheus,从展示图反推文生图模型的在售提示词
Prometheus 是针对文生图市场 showcase 的训练无关提示词窃取:攻击者看不到在售文本,只用本地开源 proxy 恢复 subject 和 modifier,并希望换 subject 后风格仍在。