防御arXiv 2609.32602·9月26日AnchorRep:用表征排斥防御 LLM 跨模型对抗迁移攻击提出 AnchorRep,用 LoRA 推离有害提示表征以防御跨模型越狱迁移arXiv2609.32602发表9月26日层模型层场景模型与 API攻击者无盒(离线迁移)防御模型加固攻击越狱深度解读完整解读