攻击arXiv 2610.05894
研究者提出闭环偏见注入攻击
提出闭环激活引导,在扩散语言模型去噪过程中注入定向偏见
- arXiv
- 2610.05894
- 发表
- 层
- 模型层
- 场景
- 模型与 API
- 攻击者
- 灰盒
- 测试
- LLaDA-8B-Instruct、Dream-v0-Instruct-7B、LLaDA-MoE-7B-A1B-Instruct
摘要通过去噪中间概率反馈动态调节残差流转向,证明扩散语言模型在推理服务栈中存在闭环偏见注入脆弱性。
另有 62 篇论文还没打上分类标签,暂不在筛选结果里。
提出闭环激活引导,在扩散语言模型去噪过程中注入定向偏见
摘要通过去噪中间概率反馈动态调节残差流转向,证明扩散语言模型在推理服务栈中存在闭环偏见注入脆弱性。
提出 Bi-QSTO,优化能穿过质量筛选并在微调中削弱安全对齐的投毒样本
Bi-QSTO 研究一个实际训练缺口:基于质量的数据选择会先于微调决定样本去留,而以往微调投毒多假设毒样本直接进入训练集。已对齐 LLM 的拒答会被少量有害或看似无害的微调样本削弱。作者用三个问题串起实验:选择能否排除毒样本。
提出四种阶段转换攻击,绕过推理模型的安全推理护栏
提出 DIVA,利用跨步条件传播对离散扩散视觉语言模型实施视觉越狱
提出 GhostWord 词级触发后门,对自动语音识别做数据投毒
提出参考嫁接,在推理时用激活干预诱导出沙袋隐藏的能力
摘要提出参考嫁接在推理阶段以低成本匹配微调诱导效果,揭示隐瞒表征重叠与阈值门控机制。
提出 AGENTQ,向开源智能体权重植入仅在量化后触发的恶意工具后门
摘要论文研究了智能体量化条件后门风险,提出 AGENTQ 在保持效用的同时实现全精度隐蔽与量化后生效。
提出跨架构攻击 CSR,用概念分数参数重学习恢复文生图被擦除概念