SafeArena:评测自主网页 Agent 的安全性
研究者提出 SafeArena,用于评测自主网页 Agent 面对正常任务与恶意任务时的行为。该评测采用分层风险框架,区分 Agent 拒绝、尝试以及完成有害任务等不同结果。
- arXiv
- 2503.04957
- 发表
研究者提出 SafeArena,用于评测自主网页 Agent 面对正常任务与恶意任务时的行为。该评测采用分层风险框架,区分 Agent 拒绝、尝试以及完成有害任务等不同结果。
论文 WAAA!Web Adversaries Against Agentic Browsers 扩展了浏览器 Agent 的威胁模型,把传统网页攻击与语言模型风险放在一起考察。
研究者提出 TRAP,一个面向网页 Agent 的任务重定向说服基准,用于测量网页任务中界面与上下文说服对 Agent 目标遵循的影响,并比较不同模型被重定向的易感性。
论文 BrowseSafe 研究 AI 浏览器 Agent 在真实网页结构中面临的提示注入风险,并提出结合架构保护与模型防御的多层防护方案。
WAInjectBench 是一个面向网页 Agent 的提示注入检测基准,系统比较针对网页 Agent 的文本与图像注入检测方法,并分析不同威胁模型下的检测盲点。
论文提出 WebInject,研究网页截图中的视觉扰动对多模态网页 Agent 动作选择的影响,并与现有方法进行实验比较。
WASP 是一个评估网页 Agent 抵御提示注入攻击能力的基准,提供贴近网页使用场景的端到端评估。该基准区分攻击局部奏效与 Agent 真正完成攻击目标两种情况,用于衡量注入攻击对 Agent 的实际影响。
论文提出 BrowserART,用于检验聊天模型的拒答行为能否迁移到具备浏览器操作能力的 Agent。该工作围绕这一迁移问题构建测试,发现经过拒答训练的大语言模型在作为浏览器 Agent 时容易被越狱。
研究者提出 ST-WebAgentBench,一个用于评估网页 Agent 安全与可信度的基准。该基准将策略遵守、用户同意等约束纳入网页任务评估,区分完成任务与在约束内完成任务两种情况。
论文以 VisualWebArena 中的网页 Agent 为对象,分析多组件系统中的对抗风险,并考察反思、搜索等组件对安全性的影响。
APEXA 面向同步辐射数据约简的多智能体 LLM 自动化流程,通过检查工具是否真正执行、并以确定性约束限制设备动作,来评估执行完整性与操作安全。
SciTrace 是一种面向科学发现智能体的轨迹感知安全推理方法,将风险状态带入多阶段科研流程,并在执行前检查工具链组合风险。该研究同时评估其安全性与科研任务质量。
研究者提出 SciIntegrity-Bench,一个用于评估 AI Scientist 系统学术诚信的基准。
LABSHIELD 是一个面向科学实验室场景的多模态基准,用于评估风险识别、安全推理与操作规划,覆盖多模态及具身系统。该基准关注科研自动化进入真实实验环境后的安全边界。
研究者提出 SafeScientist 安全监测框架,覆盖科研流程,并配套 SciSafetyBench 评估风险识别与正常任务表现。该框架面向 LLM 智能体,目标是让科学发现过程具备风险感知能力。
论文《Risks of AI Scientists》梳理了自主科研 Agent 的漏洞与误用风险,主张把保障置于自主性之上。作者从人的管理、Agent 对齐和环境反馈三方面讨论保障措施。
一项研究提出面向科学 AI 的 Agent 风险控制层,并用安全任务与正常任务共同评估。该研究强调,风险降低不能以丧失正常科学用途为代价。
研究者提出 MAFIA,一种针对带记忆 LLM Agent 的查询式记忆攻击框架,通过探测与事实注入绕过输入审计。该方法包含两部分:一是通过记忆探测、预算分配和调度保证注入记录在检索中具有竞争力。
研究者提出提示词学习攻击框架 PLA,用于在无法获取模型架构与参数的黑盒条件下绕过文生图模型的安全机制。此前方法多依赖词替换搜索对抗提示词,受限于搜索空间,效果不如基于梯度的训练。