防御arXiv 2609.32602·9月26日AnchorRep:用表征排斥防御 LLM 跨模型对抗迁移攻击提出 AnchorRep,用 LoRA 推离有害提示表征以防御跨模型越狱迁移arXiv2609.32602发表9月26日层模型层场景模型与 API攻击者无盒(离线迁移)被测模型Llama-3-8B、Mistral-7B、Vicuna-7B 等 5 个防御模型加固攻击越狱深度解读完整解读