攻击arXiv 2510.02833·2025年10月3日研究者提出用 10 条良性问答对微调越狱 LLM 的两阶段攻击提出两阶段良性微调攻击,经 FaaS 用良性数据解除安全对齐arXiv2510.02833发表2025年10月3日层训练与数据层场景模型与 API被测模型Llama2-7b-chat-hf、Llama3-8b-instruct、Deepseek-R1-Distill-Llama3-8b 等 10 个攻击模型篡改技术针对防御组件微调与开源权重+1+1深度解读完整解读