跳到正文
原文
论文追踪· arXiv:2410.06703·本站收录 · 原文发表

ST-WebAgentBench:评估 Web Agent 安全与可信度的基准

ST-WebAgentBench: A Benchmark for Evaluating Safety and Trustworthiness in Web Agents

AI 导读

研究者提出 ST-WebAgentBench,一个面向企业场景评估 Web Agent 安全与可信度(ST)的可配置、易扩展基准。其 222 个任务各配有编码约束的 ST 策略,并从用户同意、鲁棒性等六个维度评分。除任务成功率外,作者提出 Completion Under Policy(CuP)指标,只计入遵守全部适用策略的完成,以及量化各维度 ST 违规的 Risk Ratio。对三个开源 SOTA Agent 的评测显示,其平均 CuP 不足名义完成率的三分之二,暴露出安全缺口。作者开源了代码、评测模板和策略编写界面。

阅读原文arxiv.org