研究者提出 Staged Decoding 与 SFT 数据集,减少大推理模型推理轨迹中的隐私泄露
研究者针对大推理模型(LRM)推理轨迹常含敏感信息、且可能被提示注入暴露的问题,提出把隐私指令当作可控性任务来处理。他们构建了一个 SFT 数据集,让模型在整个推理过程中遵循通用指令,并提出 Staged Decoding 解码策略,用独立的 LoRA 适配器分别生成推理轨迹和答案,以最大化各部分的指令遵循能力。在来自两个模型族的六个模型(1.7B 至 14B 参数)上,跨两个指令遵循基准和两个隐私基准评测,该方法在指令遵循上最高提升 20.9 分,在隐私基准上最高提升 51.9 个百分点,但可能因推理性能与指令遵循之间的权衡而损失任务效用。代码已公开,论文被 EMNLP 2026 主会接收。