评测与基准arXiv 2609.31342
研究揭示过期文档投毒:RAG 检索可让模型放弃原本正确的答案
构建知识逆转基准,评测陈旧检索证据如何推翻模型原本正确的回答
- arXiv
- 2609.31342
- 发表
- 层
- 应用层
- 场景
- LLM 应用
- 测试
- GPT-4o、GPT-4.1、Claude-Opus-4.5 等 13 个
- 组件RAG
摘要论文评测了陈旧检索推翻正确知识的中毒现象,并分析了其内部机制与防御局限。
这篇论文是对检索增强生成(RAG)中“陈旧文档中毒”现象的实证与机理评估研究。
构建知识逆转基准,评测陈旧检索证据如何推翻模型原本正确的回答
这篇论文是对检索增强生成(RAG)中“陈旧文档中毒”现象的实证与机理评估研究。
构建 COUNTER-GEO-BENCH,评测生成式搜索对信息扭曲 GEO 的防御
摘要论文构建了针对 GEO 虚假信息的首个防御基准,揭示通用护栏的失效与反作用,并提出了有效的轻量对比检测基线。
用 FairMedAgent 测量临床智能体在输入不变时的动作不稳定性下限
FairMedAgent 把临床智能体公平审计里的采样噪声单独量出来:输入不变时动作仍会改变,这个比率就是解读翻转率的下限。。
提出 PIDS-Bench,评测提示注入检测器在过度防御与分布偏移下的表现
PIDS-Bench 是一个冻结的检测器级基准,用来在固定阈值下同时看提示注入检测和良性误报。
提出 RAIM,用交叉拟合堆叠聚合廉价评审检测幻觉
摘要十个廉价评审的堆叠在可采纳区间接近 Sonnet,代价主要是一次域内校准。
提出 LongPIBench,评测长文档场景下的提示注入攻击与防御
摘要论文构建长文本提示注入基准 LongPIBench,揭示启发式与优化攻击在长文档中的高有效性及现有防御的大幅失效。
评测 System One 模型对 Agent 安全输入的分类可靠性与校准
Liu 离线评测 System One 模型能否为智能体安全输入给出可自动化的概率决策。问题是分类是否可靠,以及概率能否在指定漏检和误拦上限内支持放行、拦截或复核。