防御arXiv 2609.32602·9月26日AnchorRep:用表征排斥防御 LLM 跨模型对抗迁移攻击提出 AnchorRep,用表征排斥防御跨模型越狱迁移arXiv2609.32602发表9月26日层训练与数据层场景模型与 API攻击者无盒、白盒测试Llama-3-8B、Mistral-7B、Vicuna-7B 等 5 个防御模型加固攻击越狱深度解读完整解读