攻击arXiv 2610.05894
研究者提出闭环偏见注入攻击
提出闭环激活引导,在扩散语言模型去噪过程中注入定向偏见
- arXiv
- 2610.05894
- 发表
- 层
- 模型层
- 场景
- 模型与 API
- 攻击者
- 灰盒
- 测试
- LLaDA-8B-Instruct、Dream-v0-Instruct-7B、LLaDA-MoE-7B-A1B-Instruct
摘要通过去噪中间概率反馈动态调节残差流转向,证明扩散语言模型在推理服务栈中存在闭环偏见注入脆弱性。
提出闭环激活引导,在扩散语言模型去噪过程中注入定向偏见
摘要通过去噪中间概率反馈动态调节残差流转向,证明扩散语言模型在推理服务栈中存在闭环偏见注入脆弱性。
提出只改 SAE 解码器的后门,在冻结语言模型上植入代码插入
只改 SAE 解码器、冻结编码器与语言模型,即可把代码插入行为放进推理时的辅助组件。作者把这视为 SAE 供应链问题:checkpoint 一旦替换某一层激活,就参与后续计算,而不只是解释工具。
提出 LiBRA,在潜空间双向优化以规避图像水印双侧检测
摘要LiBRA 用双向潜空间优化规避双侧水印检测,并提高相对反转基线的保真。
用通用扰动对恶意软件分类器及漂移检测器做规避与后门投毒