攻击arXiv 2610.01367
研究:高质量数据筛选挡不住投毒
提出 Bi-QSTO,优化能穿过质量筛选并在微调中削弱安全对齐的投毒样本
- arXiv
- 2610.01367
- 发表
- 场景
- 模型与 API
- 测试
- Llama2-7B-Chat、Llama3-8B-Instruct、Llama2-13B-Chat 等 5 个
摘要质量筛选挡不住部分高分样本的安全削弱。
Bi-QSTO 研究一个实际训练缺口:基于质量的数据选择会先于微调决定样本去留,而以往微调投毒多假设毒样本直接进入训练集。已对齐 LLM 的拒答会被少量有害或看似无害的微调样本削弱。作者用三个问题串起实验:选择能否排除毒样本。