WAInjectBench 系统评测网页 Agent 的提示注入检测方法
WAInjectBench: Benchmarking Prompt Injection Detections for Web Agents
AI 导读
论文提出 WAInjectBench,称这是首个针对网页 Agent 提示注入检测的系统性基准研究。作者按威胁模型对这类攻击做了细粒度分类,并构建了包含恶意与良性样本的数据集,覆盖不同攻击生成的恶意文本、四类良性文本、攻击生成的恶意图像以及两类良性图像。研究随后系统梳理了基于文本和基于图像的检测方法,并在多种场景下评测其表现。主要发现是:部分检测器能以中高准确率识别依赖显式文本指令或可见图像扰动的攻击,但对省略显式指令或采用不可感知扰动的攻击基本失效。数据集与代码已公开。