研究者提出闭环偏见注入攻击,可将 LLaDA-8B 的 BBQ 目标差距从 1.8 提升至 16.7 个百分点
提出闭环激活引导,在扩散语言模型去噪过程中注入定向偏见
- 研究定位:该论文揭示了扩散语言模型(dLLMs)去噪轨迹作为推理时控制通道的新型安全脆弱性。
- 解决的问题:针对冻结扩散语言模型在推理服务栈可能遭受的灰盒操控风险,研究攻击者如何在不更改模型权重、提示词及采样器的情况下,操纵模型在歧义问题上输出指定受保护群体的偏见回答。
- 核心方法设计:提出了闭环目标偏见注入方法,离线提取残差流中区分目标与对照选项的均值差单位向量,在线去噪过程中通过比例-积分(PI)控制器实时跟踪未提交答案的目标概率,动态调节注入残差流的引导强度。
- 核心实验结果:
- 在 LLaDA-8B-Instruct 的 BBQ Black 目标上,Decode PI 将目标-对照组差距从未引导的 1.8 pp 提升至 16.7 pp(∆g = +14.9 pp),而固定强度开环仅达 4.6 pp(Table 1)。
- 在 SocialStigmaQA 上,Decode PI 将偏见选项选择率从 17.6% 提升至 58.1%(严格解析器下 ∆g = +83.8 pp,Table 2)。
- 跨目标测试中,LLaDA-8B 在 Arab 和 Old 目标上分别取得 22.3 pp 和 31.8 pp 的偏见差距(Table 3),但在 Asian、White、Latino 上因无效输出率过高(59.6%–96.1%)导致攻击失败。
- 跨模型测试中,在 Dream-7B 上 PI 取得 7.5 pp 差距(∆g = +4.2 pp),而在 LLaDA-MoE 上以 23.3 pp 落后于调优常数 CAA 的 25.6 pp(Table 3)。
- 作者的结论与启示:作者认为模型的公平性不仅取决于权重本身,更是整个部署服务系统的属性;仅针对模型检查点的离线安全审计无法发现此类服务层激活操纵,未来的安全审计应直接针对已部署的推理端点。