防御arXiv 2602.24210
研究者提出 Staged Decoding 与 SFT 数据集,减少大推理模型推理轨迹中的隐私泄露
提出 Staged Decoding 与指令跟随训练,减少推理轨迹隐私泄露
- arXiv
- 2602.24210
- 发表
- 层
- 模型层
- 场景
- 模型与 API
摘要用一般指令跟随训练加分段解码,可降低轨迹隐私泄露,但数学效用下降。
本文把大推理模型的隐私问题做成轨迹可控性:隐私指令是指令,轨迹不跟随就会把敏感上下文写进可被提示注入导出的文本。
提出 Staged Decoding 与指令跟随训练,减少推理轨迹隐私泄露
本文把大推理模型的隐私问题做成轨迹可控性:隐私指令是指令,轨迹不跟随就会把敏感上下文写进可被提示注入导出的文本。
提出 VidMark 水印方案,核验视频生成模型的输出来源与所有权
Huang 等人提出一套面向视频生成模型的生成内嵌水印方案,用来同时判断一条视频是否来自受保护模型,以及一个嫌疑模型是否为该模型的拷贝。
提出 ARIA,在冻结权重上用 SAE 做推理时遗忘门控
提出 RAPID,离线把抗蒸馏扰动写入文生图解码器