研究者提出闭环偏见注入攻击
提出闭环激活引导,在扩散语言模型去噪过程中注入定向偏见
完整解读
提出闭环激活引导,在扩散语言模型去噪过程中注入定向偏见
提出 Bi-QSTO,优化能穿过质量筛选并在微调中削弱安全对齐的投毒样本
Bi-QSTO 研究一个实际训练缺口:基于质量的数据选择会先于微调决定样本去留,而以往微调投毒多假设毒样本直接进入训练集。已对齐 LLM 的拒答会被少量有害或看似无害的微调样本削弱。作者用三个问题串起实验:选择能否排除毒样本。
提出参考嫁接,在推理时用激活干预诱导出沙袋隐藏的能力
提出 AGENTQ,向开源智能体权重植入仅在量化后触发的恶意工具后门