研究揭示文本水印会诱发模型幻觉,并提出两种缓解干预
研究者在受控RAG设定下评估六种文本水印,发现水印会导致事实准确率下降,并通过词元与注意力干预使该损失降低约90%。
- 12.9%LLaMA3.1-8B在KGW水印下TPR=0.90时的∆fact(Table 1)
- 0.9%LLaMA3.1-8B在KGW+FPTI+FPAI下TPR=0.90时的∆fact(Table 1)
- 93.0%LLaMA3.1-8B下FPTI+FPAI相比KGW的∆fact相对降低幅度(Table 2)
论文探究生产环境文本水印如何诱发或放大模型事实错误,并分析其解码层生成机制与干预方案。
论文梳理了文本水印、水印真实性风险、受控RAG事实评测与解码期幻觉缓解四类相关工作并对比定位。
论文将水印幻觉形式化为事实容限压缩,归因为词元扰动与前缀注意力漂移,并提出 FPTI 与 FPAI 两项干预。
论文在三款模型和六种水印上测试,发现水印引发事实准确率下降,联合干预使净损失降低约90%。
论文指出了强水印与长序列下的残余误差及评测范围局限,后续可探索显式事实约束水印。
论文揭示了生产环境文本水印导致模型事实退化的失效模式,分析了解码机制并提出针对性干预。