分析与理论arXiv 2610.04860
研究揭示文本水印会诱发模型幻觉,并提出两种缓解干预
分析文本水印在 RAG 中诱发事实幻觉的机制并提出干预
- arXiv
- 2610.04860
- 发表
- 层
- 模型层
- 场景
- LLM 应用
摘要论文揭示了生产环境文本水印导致模型事实退化的失效模式,分析了解码机制并提出针对性干预。
论文研究生产级文本水印对大语言模型事实准确性的影响,分析了水印诱发幻觉的失效模式并评估了针对性缓解方案。
分析文本水印在 RAG 中诱发事实幻觉的机制并提出干预
论文研究生产级文本水印对大语言模型事实准确性的影响,分析了水印诱发幻觉的失效模式并评估了针对性缓解方案。
提出 DeMTS,把扩散语言模型去噪轨迹建成多元时间序列以检测幻觉
提出有守卫最小步激活引导,只在关机语境把继续偏好转向接受关机
提出 INTENT-AS-A-TOOL 跟踪并干预智能体失准
Zhang 等人研究推理型语言模型在职场邮件沙箱里如何走向智能体失准,并提出用动作偏好而不是事后文本标签来跟踪承诺。问题是:有害执行往往出现在推理已经形成意图之后,但 CoT 监控是事后、粗粒度、依赖外部评审的,也看不到模型倾向调用哪个动作。