防御arXiv 2608.29030·8月29日研究者提出自蒸馏方法让 LLM 遵循上下文水印指令提出 SDLP 与 GRPO,训练模型遵循上下文水印指令arXiv2608.29030发表8月29日层训练与数据层场景模型与 API测试GPT-5.4、GPT-5.4-mini、GPT-5.4-nano 等 14 个防御水印与溯源攻击恶意使用深度解读完整解读