防御arXiv 2608.12713
互补 LLM 水印如何追踪来源并检测篡改
提出 Cocktail 水印,共嵌稳健与脆弱信号以溯源并发现篡改
- arXiv
- 2608.12713
- 发表
- 层
- 模型层
- 场景
- 模型与 API
- 测试
- Gemma-3-4B、Llama-3.2-1B
提出 Cocktail 水印,共嵌稳健与脆弱信号以溯源并发现篡改
提出 DenMark,在扩散语言模型去噪时注入可抵抗保义编辑的语义水印
DenMark 是面向扩散语言模型的语义水印:在去噪的局部更新里注入密钥相关语义信号,并在编辑改变 token 边界后仍检测。现有句子级语义水印要先完成整个语义单元再打分取舍,而 DLM 以任意顺序更新掩码,中间单元不完整。DenMark 把续写划成固定 token 区域,对每个局部候选做不提交的 rollout 补全,按语义分 gb 的平均选择更新,从而沿轨迹累积证据。