防御arXiv 2608.12713
互补 LLM 水印如何追踪来源并检测篡改
提出 Cocktail 水印,共嵌稳健与脆弱信号以溯源并发现篡改
- arXiv
- 2608.12713
- 发表
- 层
- 模型层
- 场景
- 模型与 API
- 测试
- Llama-3.2-1B、Gemma-3-4B
提出 Cocktail 水印,共嵌稳健与脆弱信号以溯源并发现篡改
提出 VERITAS,用双边背书剪除本地隐私图学习中的投毒节点
VERITAS 是面向本地差分隐私图学习的投毒防御协议,按 trust-but-verify 在保持 ϵ-LDP 的同时剪除伪造节点。
提出联邦学习细粒度分布式后门框架 FDBA,用动态触发与对比嵌入降低投毒比例
分析近重复族如何让精确记录成员推断误判为入训
作者研究成员推断能否作为精确记录的数据来源证据。版权和来源审计需要的是该记录本身是否入训,而网页语料中的转载、镜像和轻改会让非同一近重复产生成员样分数。四世界审计用 E 表示精确记录是否入训、用 F 表示其近重复族是否在场,从而分开 H00 到 H10 的标准 MI、H00 到 H01 的族偏移,以及 H01 到 H11 的 exact-given-family。