评测与基准arXiv 2609.31342
研究揭示过期文档投毒:RAG 检索可让模型放弃原本正确的答案
评测 RAG 中过期文档推翻模型原本正确回答的现象
- arXiv
- 2609.31342
- 发表
- 层
- 应用层
- 场景
- LLM 应用
- 测试
- GPT-4o、GPT-4.1、Claude-Opus-4.5 等 13 个
- 组件RAG
摘要论文评测了陈旧检索推翻正确知识的中毒现象,并分析了其内部机制与防御局限。
这篇论文是对检索增强生成(RAG)中“陈旧文档中毒”现象的实证与机理评估研究。
评测 RAG 中过期文档推翻模型原本正确回答的现象
这篇论文是对检索增强生成(RAG)中“陈旧文档中毒”现象的实证与机理评估研究。
构建 COUNTER-GEO-BENCH,评测生成式搜索中的 GEO 虚假信息防御
摘要论文构建了针对 GEO 虚假信息的首个防御基准,揭示通用护栏的失效与反作用,并提出了有效的轻量对比检测基线。
构建分子肿瘤委员会审计基准,测量临床过度拒答
提出 MIST 压力测试,检验无关图像是否扰动 VLM 评判者标签
作者用MIST问:VLM 代替人类标注时,可替代性裁决会不会被指南要求忽略的图像改写。
提出 Box2-Bench,评测模型能否选择性依赖外部工作流
Box2-Bench 固定任务与模型,只改变工作流可靠性,用来衡量模型能否选择性依赖可能出错的外部指导。
提出 LongPIBench,评测长文档场景下的提示注入攻击与防御
摘要论文构建长文本提示注入基准 LongPIBench,揭示启发式与优化攻击在长文档中的高有效性及现有防御的大幅失效。