研究揭示文本水印会诱发模型幻觉,并提出两种缓解干预
揭示检索生成中文本水印诱发事实幻觉的机制并提出 FPTI 与 FPAI 干预
论文研究生产级文本水印对大语言模型事实准确性的影响,分析了水印诱发幻觉的失效模式并评估了针对性缓解方案。
揭示检索生成中文本水印诱发事实幻觉的机制并提出 FPTI 与 FPAI 干预
论文研究生产级文本水印对大语言模型事实准确性的影响,分析了水印诱发幻觉的失效模式并评估了针对性缓解方案。
提出校准重合成认证,仅当已知生成器都不能保真重构时签发真实图像证书
提出功能标准判断模型权重是否构成作品副本
Lemley 与 Cooper 认为,生成式模型的权重是否构成受保护作品的版权法“副本”,取决于该作品能否被直接了当地从输出中提取。。
提出匹配比较校准,界定生成训练序列何时算可抽取记忆
Cooper 等人从第一性原理重写 extractable memorization:生成训练文本只有在概率高过匹配非训练文本的可预测性基线时,才支持记忆声称。
提出用扰动蒸馏本地代理并离线过滤来提取黑盒模型凭据