防御arXiv 2608.29030
研究者提出自蒸馏方法让 LLM 遵循上下文水印指令
提出 SDLP 与 GRPO,训练模型遵循上下文水印指令
- arXiv
- 2608.29030
- 发表
- 场景
- 模型与 API
- 测试
- GPT-5.4、GPT-5.4-mini、GPT-5.4-nano 等 14 个
提出 SDLP 与 GRPO,训练模型遵循上下文水印指令
提出 CorrGRPO,用组内 Pearson 相关归一化多奖励 GRPO
CorrGRPO 是 GRPO 的多奖励变体:组内优势的分子仍是中心化总奖励,分母改为 Pearson 相关之和,避免大尺度奖励主导归一化。