跳到正文
原文
论文追踪· arXiv:2504.18575·本站收录 · 原文发表 精选关注度54

Meta 等发布 WASP 基准,端到端评测网页 Agent 的提示注入攻击

WASP: Benchmarking Web Agent Security Against Prompt Injection Attacks

论文速读

据论文全文整理(AI 生成),以原文为准

AI 导读Meta FAIR 等机构的研究者发布 WASP,一个基于 VisualWebArena 沙箱环境、面向网页 Agent 的提示注入安全基准,代码与基准开源。

问题
自主 UI/web agent 能帮用户完成报税、缴费等多步任务,但因其可代为行动,prompt injection 带来的安全风险尤为突出。现有测试要么威胁模型过于简化、给攻击者过大权限,要么只测孤立的单步任务,且许多基准未公开,社区缺乏统一衡量方式。
方法
作者提出 WASP,一个基于 VisualWebArena 沙箱(gitlab、reddit 两个环境)的公开端到端基准,用真实可运行网站模拟攻击。攻击者被设定为网站上的对抗性用户,只能注入特定页面元素、对 agent 是黑盒,攻击目标为需多步完成的现实安全违规;用 plain-text 与 URL 两类注入模板,并定义 ASR-intermediate 与 ASR-end-to-end 等指标。
实验与结果
评估了 GPT-4o、GPT-4o-mini、o1、Claude Sonnet 3.5 v2 与 3.7 及多种 scaffolding。结果显示 agent 很容易被劫持,ASR-intermediate 最高达 86%,但完整实现攻击者目标的比例仅 0–17%,作者称之为“security by incompetence”。instruction hierarchy 与防御性 system prompt 等缓解手段下,攻击仍能影响模型行为,且 URL 注入、任务相关注入效果更强。
局限与可以继续做的
基准目前只覆盖 reddit 和 gitlab 两个环境,攻击提示种类有限;作者希望扩展到更多网站(如 Wikipedia、Kayak)、桌面与代码 agent 等其他 agentic 任务,并发展更有效的攻击技术来提升成功率。
AI 导读和推荐理由该基准在自托管的 GitLab 和 Reddit 环境中,把攻击者限定为只能发布 issue、评论或帖子的普通用户,并设置需要多步完成的攻击目标,共 84 个任务。评测显示,GPT-4o、GPT-4o-mini、o1、Claude Sonnet 3.5 v2 和 Claude Sonnet 3.7 Extended Thinking 等模型在低成本的纯人工注入下,被劫持并偏离用户目标的 ASR-intermediate 最高达 86%,但真正完成攻击者目标的 ASR-end-to-end 最高仅 17%。作者将这种劫持容易、完成困难的现象称为安全源于无能,并指出随着 Agent 能力提升,这一限制不太可能持续。

Meta FAIR 等机构的研究者发布 WASP,一个基于 VisualWebArena 沙箱环境、面向网页 Agent 的提示注入安全基准,代码与基准开源。该基准在自托管的 GitLab 和 Reddit 环境中,把攻击者限定为只能发布 issue、评论或帖子的普通用户,并设置需要多步完成的攻击目标,共 84 个任务。评测显示,GPT-4o、GPT-4o-mini、o1、Claude Sonnet 3.5 v2 和 Claude Sonnet 3.7 Extended Thinking 等模型在低成本的纯人工注入下,被劫持并偏离用户目标的 ASR-intermediate 最高达 86%,但真正完成攻击者目标的 ASR-end-to-end 最高仅 17%。作者将这种劫持容易、完成困难的现象称为安全源于无能,并指出随着 Agent 能力提升,这一限制不太可能持续。

推荐理由WASP 在自托管 GitLab 与 Reddit 环境中端到端测量网页 Agent 的提示注入风险,并给出劫持率与攻击完成率的差距。

深度解读生成中

阅读原文arxiv.org