攻击arXiv 2610.01367·10月2日研究:高质量数据筛选挡不住投毒提出 Bi-QSTO,优化能穿过质量筛选并在微调中削弱安全对齐的投毒样本arXiv2610.01367发表10月2日层训练与数据层场景模型与 API攻击投毒与后门技术梯度与表征优化组件微调与开源权重+1+1摘要质量筛选挡不住部分高分样本的安全削弱。Bi-QSTO 研究一个实际训练缺口:基于质量的数据选择会先于微调决定样本去留,而以往微调投毒多假设毒样本直接进入训练集。已对齐 LLM 的拒答会被少量有害或看似无害的微调样本削弱。作者用三个问题串起实验:选择能否排除毒样本。深度解读完整解读