摘要质量筛选挡不住部分高分样本的安全削弱。
Bi-QSTO 研究一个实际训练缺口:基于质量的数据选择会先于微调决定样本去留,而以往微调投毒多假设毒样本直接进入训练集。已对齐 LLM 的拒答会被少量有害或看似无害的微调样本削弱。作者用三个问题串起实验:选择能否排除毒样本。
- 攻击arXiv 2609.27422
RAMP:逆转对抗扰动以增强针对恶意软件检测器的干净标签后门攻击
提出 RAMP,逆转对抗扰动加强恶意软件检测器的干净标签后门
- arXiv
- 2609.27422
- 发表
- 场景
- 模型与 API
摘要RAMP 用反转扰动做 clean-label 投毒。
RAMP 是 score-based black-box 下的 clean-label 后门增强,对象是会微调的 Windows PE 原始字节恶意软件检测器。
已经到底了