防御arXiv 2610.02817
RMCW:基于 Reed-Muller 码的抗删除 LLM 水印方法
提出抗删除水印 RMCW,在生成时注入 Reed-Muller 结构并做局部检验
- arXiv
- 2610.02817
- 发表
- 层
- 模型层
- 场景
- 模型与 API
- 测试
- OPT-1.3B、Llama-3.1-8B-Instruct
提出抗删除水印 RMCW,在生成时注入 Reed-Muller 结构并做局部检验
提出 EXE-Bench 比较 Windows 恶意软件检测器的可用性权衡
EXE-Bench 用同一设置给 AI Windows 恶意软件检测器做四指标排序,而不是只比一次测试集准确率。。
利用加密思维块的跨模型重放,诱导弱模型逐字转写专有推理链
摘要论文揭示了客户端加密思维块跨模型互换漏洞,提出了低成本提取方法并给出防御方案。
提出成对无失真水印 TTMARK,增强低熵下的机器文本检测
TTMARK 是一种成对、无失真的文本水印:对相邻 token 的联合分布重加权,而不是逐 token 独立重加权。
提出 Cocktail 水印,共嵌稳健与脆弱信号以溯源并发现篡改
提出 DenMark,在扩散语言模型去噪时注入可抵抗保义编辑的语义水印
DenMark 是面向扩散语言模型的语义水印:在去噪的局部更新里注入密钥相关语义信号,并在编辑改变 token 边界后仍检测。现有句子级语义水印要先完成整个语义单元再打分取舍,而 DLM 以任意顺序更新掩码,中间单元不完整。DenMark 把续写划成固定 token 区域,对每个局部候选做不提交的 rollout 补全,按语义分 gb 的平均选择更新,从而沿轨迹累积证据。