研究者提出用 10 条良性问答对微调越狱 LLM 的两阶段攻击
Attack via Overfitting: 10-shot Benign Fine-tuning to Jailbreak LLMs
AI 导读
南洋理工大学研究者提出一种两阶段微调攻击,仅用 10 条完全良性的问答对即可越狱大语言模型。第一阶段用相同拒答答案的良性问答对微调,使模型过拟合到拒答行为;第二阶段用标准答案微调同一批问题,模型随之遗忘拒答关联,对包括有害问题在内的提问都给出顺从回答。在 Llama2-7b、Llama3-8b、Deepseek-R1-Distill-Llama3-8b、Qwen2.5-7b、Qwen3-8b 及 GPT-4o-mini、GPT-4.1-mini、GPT-3.5-turbo、GPT-4o、GPT-4.1 十个模型上,该方法平均攻击成功率 94.84%、有害分 4.48,接近使用显式有害数据的恶意微调(97.25% ASR),而数据集有害分与良性数据同为 1。作者称该攻击还能绕过针对前几个 token 损失的防御微调,在 Llama2-7b 上仍达 92.11% ASR。代码已开源。
推荐理由
论文提出仅用 10 条良性问答对即可越狱大模型的两阶段微调方法,并给出在 10 个模型上的攻击成功率与隐蔽性对比。