LongPIBench:面向长上下文提示注入的评测基准
研究者提出 LongPIBench,一个覆盖论文评审、简历筛选、代码审查和邮件摘要四个真实场景的长上下文提示注入评测基准,每个场景包含合成数据集与真实数据集,上下文长度从数千到数万 token。评测显示,在无防御时简单启发式攻击即可取得高攻击成功率,例如 Combined Attack 在合成论文评审数据集上 ASR 达 100%;作者新提出的 Authority spoof 攻击在所有启发式攻击中 ASR 最高,在 GPT-4.1 和 GPT-4o 的论文评审与简历筛选任务上超过 0.75。基于 GCG 的优化攻击效果更强,在论文评审和简历筛选上 ASR 达 1.00。作者指出,注入位置在文档中部或末尾时 ASR 更高,且单个注入提示可同时实现多个对抗目标。代码与数据已开源于 GitHub。
推荐理由长上下文场景下防御几乎失效的实测数据,为部署长文档处理流程的团队提供了重新评估护栏的参照。