跳到正文
原文
arXiv:越狱、提示注入、投毒与防御· arXiv:2610.08571· Niveen O. Jaffal, Ahmet Yuksel, David Mohaisen·本站收录 · 原文发表 日期未标

RAG-PIBench:可信 RAG 系统中提示注入检测的泄漏感知基准

RAG-PIBench: A Leakage-Aware Benchmark for Prompt-Injection Detection in Trustworthy RAG Systems

AI 导读

研究者提出 RAG-PIBench,一个面向 RAG 式提示注入检测的基准,包含 4,876 条上下文样本,划分为冻结的训练、验证与受保护测试集。该基准采用泄漏感知的构建流程与严格评测协议,对比了关键词、语义参考、TF-IDF 与 Transformer 类检测器。DistilBERT 在受保护测试集上取得最佳表现(F1 = 0.896,PR-AUC = 0.968),TF-IDF SVM 与逻辑回归仍具竞争力。

阅读原文arxiv.org