可解释性arXiv:2610.04860 · 10月4日研究揭示文本水印会诱发模型幻觉,并提出两种缓解干预揭示检索生成中文本水印诱发事实幻觉的机制并提出 FPTI 与 FPAI 干预LLM 应用·测试LLaMA 3.1 8B Instruct、Mistral-7B-Instruct-v0.3、Qwen2.5-14B-Instruct·模型层推理时干预幻觉与编造摘要论文揭示了生产环境文本水印导致模型事实退化的失效模式,分析了解码机制并提出针对性干预。论文研究生产级文本水印对大语言模型事实准确性的影响,分析了水印诱发幻觉的失效模式并评估了针对性缓解方案。完整解读
防御arXiv:2609.14003 · 9月12日FlowSeal:用信息流控制阻断 LLM Agent 的隐私泄露提出 FLOWSEAL,在工具边界以信息流控制阻断智能体隐私泄露AI Agent·测试DeepSeek-V3.2、DeepSeek-R1、GPT-4.1-mini 等 4 个·应用层指令与数据隔离提取与窃取权限与沙箱+1+1摘要作者分析大模型智能体隐私检查与攻击面重合问题,提出外部拦截防御 FLOWSEAL 并验证有效性。完整解读