ST-WebAgentBench:评估 Web Agent 安全与可信度的基准
ST-WebAgentBench: A Benchmark for Evaluating Safety and Trustworthiness in Web Agents
AI 导读
研究者提出 ST-WebAgentBench,一个面向企业场景评估 Web Agent 安全与可信度(ST)的可配置、易扩展基准。其 222 个任务各配有编码约束的 ST 策略,并从用户同意、鲁棒性等六个维度评分。除任务成功率外,作者提出 Completion Under Policy(CuP)指标,只计入遵守全部适用策略的完成,以及量化各维度 ST 违规的 Risk Ratio。对三个开源 SOTA Agent 的评测显示,其平均 CuP 不足名义完成率的三分之二,暴露出安全缺口。作者开源了代码、评测模板和策略编写界面。