CredLeak-Bench
提出 CredLeak-Bench,评测智能体在钓鱼场景下的凭据泄露
完整解读提出 CredLeak-Bench,评测智能体在钓鱼场景下的凭据泄露
完整解读提出 WebMirage,用对抗图像劫持视觉网页智能体的浏览器操作
WebMirage 是一个面向视觉定位网络智能体的流水线感知端到端红队攻击框架。
提出 AgentHazard 基准,评测计算机使用智能体的执行层有害行为
AgentHazard 是针对计算机使用智能体执行层安全构建的评估基准,重点探究多步工具调用下局部合理动作累积引发的危害。
提出 COBRA 双 LLM 架构,防御计算机使用智能体的分支转向攻击
提出 SCOPE 联合后训练计算机使用智能体的任务执行与安全决策
完整解读