LongPIBench:面向长上下文提示注入的评测基准
LongPIBench: A Long-Context Benchmark for Prompt Injection
AI 导读
研究者提出 LongPIBench,一个覆盖论文评审、简历筛选、代码审查和邮件摘要四个真实场景的长上下文提示注入评测基准,每个场景包含合成数据集与真实数据集,上下文长度从数千到数万 token。评测显示,在无防御时简单启发式攻击即可取得高攻击成功率,例如 Combined Attack 在合成论文评审数据集上 ASR 达 100%;作者新提出的 Authority spoof 攻击在所有启发式攻击中 ASR 最高,在 GPT-4.1 和 GPT-4o 的论文评审与简历筛选任务上超过 0.75。基于 GCG 的优化攻击效果更强,在论文评审和简历筛选上 ASR 达 1.00。作者指出,注入位置在文档中部或末尾时 ASR 更高,且单个注入提示可同时实现多个对抗目标。代码与数据已开源于 GitHub。
论文速读
- 现有 prompt injection 基准多聚焦短上下文(几十到几百 token),而真实 LLM 应用常处理数千到数万 token 的长文档,导致对现有防御有效性的评估被高估。作者认为长上下文下攻击与防御的表现尚不清楚。
- 作者提出 LongPIBench,覆盖论文评审、简历筛选、代码审查、邮件摘要四个场景,每个场景含合成数据集与真实数据集,上下文从数千到数万 token。评估六种启发式攻击(含新提出的 Authority spoofing)、两种优化攻击(GCG 及其 universal 变体),以及多种检测型与预防型防御。
- 无防御时简单启发式攻击即可高成功率,Combined Attack 在合成论文评审上 ASR 达 100%;Authority spoof 普遍优于其他启发式攻击。优化攻击更强,GCG 在论文评审和简历筛选达 1.00。检测型防御要么高 FPR 要么高 FNR;预防型防御在长上下文下大多失效,MetaSecAlign 8B 在合成论文评审上 ASR 达 100%,而它在短上下文基准上接近 0%。注入位置在中间或末尾时 ASR 更高,单一注入提示可同时达成多个目标。
- 基准只覆盖文档型长上下文任务,未涉及多步推理、工具调用、环境交互的 agentic 工作流,也未建模迭代调用等动态设置。上下文长度实验只确立现象,未区分 context dilution 与位置效应等机制。优化攻击仅限 GCG 及其 universal 变体,未覆盖自适应搜索、黑盒树搜索、强化学习攻击等更广范围。
据 论文全文(AI 生成) 整理,供快速了解,以论文原文为准。
推荐理由
长上下文场景下防御几乎失效的实测数据,为部署长文档处理流程的团队提供了重新评估护栏的参照。