防御arXiv 2608.29030
研究者提出自蒸馏方法让 LLM 遵循上下文水印指令
提出 SDLP 与 GRPO,训练模型遵循上下文水印指令
- arXiv
- 2608.29030
- 发表
- 场景
- 模型与 API
- 测试
- GPT-5.4、GPT-5.4-mini、GPT-5.4-nano 等 14 个
提出 SDLP 与 GRPO,训练模型遵循上下文水印指令
提出扩散潜空间地理扰动防御,抑制视觉语言模型泄露精确地理位置
提出 VEX-Bench 评测 LLM 生成虚假信息的核查复杂度
VEX-Bench 把 LLM 虚假信息的风险从“能否生成”改成“筛查时会占用多少核查容量”。