研究揭示文本水印会诱发模型幻觉,并提出两种缓解干预
揭示检索生成中文本水印诱发事实幻觉的机制并提出 FPTI 与 FPAI 干预
论文研究生产级文本水印对大语言模型事实准确性的影响,分析了水印诱发幻觉的失效模式并评估了针对性缓解方案。
揭示检索生成中文本水印诱发事实幻觉的机制并提出 FPTI 与 FPAI 干预
论文研究生产级文本水印对大语言模型事实准确性的影响,分析了水印诱发幻觉的失效模式并评估了针对性缓解方案。
形式化跨不可关联身份的分解攻击,并证明状态化防御的效用边界
完整解读分析分布偏移下安全路由评测的基线选择偏差与虚假下限