PIDS-Bench:在过度防御、混淆与分布偏移下评测提示注入检测器
研究者提出 PIDS-Bench,一个冻结的多轴基准,在固定阈值下同时评测提示注入检测器的攻击检测能力与良性误报行为,覆盖分布内输入、模仿注入结构但无恶意的 hard-benign 提示、混淆攻击以及领域和结构分布偏移。评测涵盖七个检测器(学习型基线、外部提示注入分类器、广义安全对比模型)以及一个基于规则的下界参考。多轴评测暴露出聚合 F1 掩盖的失效模式:在留出集上 F1 超过 0.98 的检测器,仍会把来自公开语料、限定于安全相关内容的良性子集约三分之一误判。在完整阈值扫描和五个训练种子上,没有内部检测器能在该压力分布上同时满足 F1 >= 0.95 与 hard-benign FPR <= 0.10。