防御arXiv 2609.15799
RAPID:面向文生图服务的实时防未授权蒸馏防御
提出 RAPID,离线把抗蒸馏扰动写入文生图解码器
- arXiv
- 2609.15799
- 发表
- 层
- 模型层
- 场景
- 模型与 API
- 攻击者
- 黑盒
- 被测模型
- PixArt、SSD、SDXL 等 4 个
提出 RAPID,离线把抗蒸馏扰动写入文生图解码器
提出 SafeReAct,用 LoRA 重激活后训练模型被掩盖的安全机制
这篇工作针对后训练 LLM 的安全下降,提出表示对齐方法SafeReAct。
提出 Staged Decoding 与指令跟随训练,减少推理轨迹隐私泄露
本文把大推理模型的隐私问题做成轨迹可控性:隐私指令是指令,轨迹不跟随就会把敏感上下文写进可被提示注入导出的文本。