评测与基准arXiv:2609.31342 · 9月25日研究揭示过期文档投毒:RAG 检索可让模型放弃原本正确的答案构建知识逆转基准,评测陈旧检索证据如何推翻模型原本正确的回答测试GPT-4o、GPT-4.1、Claude-Opus-4.5 等 13 个·应用层场景LLM 应用RAG摘要论文评测了陈旧检索推翻正确知识的中毒现象,并分析了其内部机制与防御局限。这篇论文是对检索增强生成(RAG)中“陈旧文档中毒”现象的实证与机理评估研究。完整解读
评测与基准arXiv:2608.28411 · 8月28日LongPIBench:面向长上下文提示注入的评测基准提出LongPIBench,评测长文档场景下的提示注入攻击与防御测试Llama-3.1-8B-Instruct、Llama-3.2-3B-Instruct、Apertus-8B-Instruct 等 11 个·应用层场景LLM 应用提示注入摘要论文构建长文本提示注入基准LongPIBench,揭示启发式与优化攻击在长文档中的高有效性及现有防御的大幅失效。研究定位:针对大语言模型长文档应用缺乏针对性安全评测的问题,作者提出了长文本提示注入基准LongPIBench。核心问题:现有提示注入基准主要评估数十至数百token的短文本,无法反映处理数万token长文档的实际部署环境,导致现有防御的有效性受到高估。方法设计:基准覆盖论文评审、简历筛选、代码审查和邮件总结4种真实决策场景,构建了合成与真实两套长文档数据集;除了评估传统启发式与基于GCG的优化攻击外,作者提出了利用社会权威线索的Authority spoof攻击,并系统评测了15种现有防御方法。主要发现:启发式攻击在无防御长文本中表现出高攻击成功率,Authority spoof在Llama-3.1-8B-Instruct与Qwen3-8B上达成1.00的ASR,在GPT-4o与GPT-4.1上也分别达到0.82与0.79(Table 1)。基于token优化的GCG攻击在长文档中依然有效,在论文评审与简历筛选上ASR达1.00,在代码审查达0.92(Table 2)。短文本下表现优良的预防防御在长文档中大多失效,MetaSecAlign 8B在短文本OPI基准的ASR为0.00,而在LongPIBench长文本聚合下升至0.78(Table 5)。检测型防御在长文本中面临分类失衡,DataSentinel等假阳性率偏高(FPR达0.54至1.00),而DeBERTa与EVD漏报率偏高(FNR达1.00),分段检测策略未能解决该矛盾(Table 3, Figure 3)。作者结论:作者认为长文本设置从根本上改变了提示注入攻防的表现,短文本安全评估无法直接外推,亟需针对长上下文特性设计新的防御策略。完整解读