AgentHazard:评估计算机使用智能体有害行为的基准
AgentHazard: A Benchmark for Evaluating Harmful Behavior in Computer-Use Agents
作者针对计算机使用智能体提出 AgentHazard 基准,GLM-4.6 在 Claude Code 下 ASR 达 82.90%。
- 计算机使用智能体具备持久状态与工具调用能力,有害行为常由局部看似合理的步骤在多轮交互中累积产生,而现有基准多局限于单轮提示词或孤立输出的安全性评测。
- 构建涵盖10类风险与10种攻击策略的AgentHazard基准,将有害目标嵌入调试与维护等合理工作流中生成任务模板,经沙箱执行过滤、模型评判与人工审核筛选出2,653个实例。
- 在3个智能体框架上评测多个模型,GLM-4.6在Claude Code下ASR达82.90%;防护分类器在单轮输入下检测率均低于5%,在全部步骤拼接下最高仅达27.03%。
- 评测仅覆盖3个框架与8个开源或可部署模型骨干;未注入专门的防御性系统提示词;防御评测仅测试了4个独立防护模型,且输入仅基于任务文本拼接而非执行轨迹。
- 模型
- Qwen2.5-72B-InstructQwen2.5-Coder-32B-InstructQwen3-32BQwen3-CoderQwen3-VL-235B-A22B-InstructKimi-K2Kimi-K2.5GLM-4.6Llama-Guard-3-8BQwen3Guard-Gen-0.6BQwen3Guard-Gen-4BQwen3Guard-Gen-8B
- 基准
- AgentHazard
- 指标
- ASRharmfulness scoreunsafe detection rate
研究者发布 AgentHazard,一个评估计算机使用智能体有害行为的基准,包含 2,653 条实例,覆盖 10 类风险与 10 种攻击策略,每条实例把有害目标嵌入一系列单看合理、累积后导致不安全执行的步骤。基准在 Claude Code、OpenClaw 和 IFlow 三个框架上,用 Qwen2.5、Qwen3、Kimi、GLM 等模型评测,结果显示当前系统仍高度脆弱:Qwen3-Coder 驱动 Claude Code 时攻击成功率达 73.63%,GLM-4.6 在 Claude Code 下达 82.90%,平均危害分 7.05。同一模型在不同框架下攻击成功率差异超过 16 个百分点,说明模型层面的对齐不能可靠迁移到智能体层面。基准提供沙箱化、模块化的评测框架与轨迹级执行数据。
推荐理由AgentHazard 用 2,653 条多步可执行任务测出智能体在累积上下文中的危害行为,并给出各框架与模型的攻击成功率对比。
深度解读
这篇论文试图解决什么问题?
现有基准难以评估计算机使用智能体在多步执行与工具调用中由局部合理操作累积涌现出的有害行为。
核心问题是评估计算机使用智能体在多轮交互、持久状态与工具调用中,由局部合理操作累积形成的执行层有害行为。
- 场景与重要性:计算机使用智能体能够操作终端、浏览器和文件系统执行长周期任务,开源与可部署模型已被广泛作为智能体底座,但其直接操作数字环境的特性带来了新的安全挑战。
- 现有方法的不足:现有大模型安全基准主要聚焦单轮提示词越狱、拒绝行为、提示注入或孤立代码生成,未能覆盖智能体在多步骤、重复工具调用与状态累积下展开的有害执行。
- 核心观察:有害行为往往并不源于显式的恶意指令,而是分散在看似合法的子任务或常规操作序列中,仅在跨步骤组合与工具执行后才显现出危害。
- 论文的提出方案:作者提出了包含 2,653 个可执行实例的基准 AgentHazard,覆盖 10 类风险与 10 种攻击策略,并配套沙箱执行环境与轨迹级评测框架。
有哪些相关研究?
相关工作涵盖大语言模型文本与代码安全评测,以及智能体能力和安全基准,但未针对多步局部合理动作组合。
论文回顾了模型安全评估与智能体基准两方面的相关研究,并指出现有工作缺乏对多步组合危害的针对性评测。
大语言模型安全与代码安全评测
- 对抗提示与越狱评估:Beyer 等人(2025)、Mou 等人(2024)和 Röttger 等人(2025)研究了对抗提示、越狱易感性与安全泛化,主要集中在单轮模型输出层面。
- 多轮代码安全评估:CodeRed(Al-Kaswan 等人,2025)与 MT-Sec(Rawal 等人,2025)评估了模型生成不安全代码的风险,并探讨了在多轮交互中模型安全性的退化情况。
智能体能力基准
- 软件工程与长流程任务:SWE-bench(Jimenez 等人,2023;Deng 等人,2025)、SWE-agent(Yang 等人,2024)与 LoCoBench-Agent(Qiu 等人,2025)评估智能体在长上下文与多步工作流中解决实际仓库级软件工程任务的能力。
智能体安全基准与防护分类器
- 特定安全攻击面评测:SEC-bench(Lee 等人,2025)、Agent Security Bench(Zhang 等人,2024)与 Agent-SafetyBench(Zhang 等人,2024)测试了智能体在提示注入、内存投毒、漏洞利用与修补等环境下的安全性。
- 文本防护模型基线:论文在防护实验中对比了 Llama-Guard-3-8B(Meta,2024)以及 Qwen3Guard 系列(Qwen Team,2025,包括 0.6B、4B、8B 版本)。
与现有工作的区别:作者指出,能力基准以任务完成度为核心,而既有安全基准局限于局部攻击面或孤立响应;AgentHazard 专注于多步可执行任务中局部合理操作经组合后涌现的有害行为,并支持轨迹级沙箱评估。
论文如何解决这个问题?
构建由 10 类风险与 10 种策略组成的分类体系,通过任务模板生成、沙箱执行过滤、模型评判与人工审核产出基准。
作者提出了面向计算机使用智能体的安全评测基准 AgentHazard,通过两维分类体系与自底向上的数据构建流水线生成多步交互测试用例。
分类体系设计
作者结合公开漏洞知识库(CVE、CWE)与相关安全文献,构建了两个正交维度的分类体系(Table 5):
- 风险类别(Risk Categories):界定智能体产生的 10 类有害后果,包括系统命令执行(System RCE)、数据窃取(Data Exfiltration)、持久化驻留(Persistence Establishment)、供应链投毒(Supply Chain Poisoning)、破坏性操作(Destructive Action)、内部侦察(Internal Reconnaissance)、权限提升(Privilege Escalation)、资源耗尽(Resource Exhaustion)、提示智能窃取(Prompt Intelligence Theft)及合规绕过(Compliance Bypass)。
- 攻击策略(Attack Strategies):界定有害意图在交互轨迹中的引入与伪装方式,共 10 种策略,包括 Direct、Recursive Salami Slicing、Security Audit Gaslighting、Dependency Hook Trigger、Pseudo Diagnostic Debugging、Contextual Persona Enforcement、Encoded Payload Smuggling、Implicit Indirect Injection、Logical Dependency Inversion 及 Legacy Code Maintenance。
种子生成与任务模板
作者将有害目标嵌入调试、评测或维护等常规工作流中,每个任务实例包含三个组件:
- 任务上下文:包含任务描述、只读文件与错误日志等真实开发背景。
- 可执行约束:程序行为断言或测试约束。
- 部分指定的工件:含有待填补字段的代码或配置文件。生成模型按类型化模式填充字段,使唯一能通过约束的解决方案即为执行有害目标,且每个局部单步均保持表观合理性。由此生成了超过 8,000 个候选实例的种子池。
过滤与人工审核流水线
为保证任务质量与可执行性,候选池经过三道筛选流程:
- 沙箱执行过滤:在沙箱环境中利用 Qwen3-Coder 驱动 Claude Code 与 OpenClaw 实际运行任务,剔除逻辑不连贯或不可执行的样本。
- 模型评判验证:利用 Gemini-3 与 GPT-5.4 对候选任务进行评判,检验其是否与预设的有害目标对齐,并确认其轨迹级有效性。
- 人工专家审核:人工核对并剔除近似重复项、纠正分类标签,最终筛选保留 2,653 个具备明确多步依赖且可执行的实例。
评测协议与判定机制
评测采用两种互补协议:
- 基于大模型的轨迹评判(LLM-as-Judge):在沙箱中运行并记录智能体的完整交互轨迹(用户输入、动作、工具调用及环境输出)。由 Gemini-3-Flash 担任裁判,依据详细评判准则(Appendix C.1)在 round_1 至 round_all 等 5 个累积轮次粒度下打分,输出二元标签(harmful: true/false)与 0 到 10 分的严重程度得分。
- 防护模型评测:评估独立安全防护分类器在未观察执行轨迹的情况下,仅对任务文本描述的识别能力。
论文做了哪些实验?
评测显示当前智能体存在脆弱性,GLM-4.6 在 Claude Code 下 ASR 达 82.90%,防护模型全轮拼接最高检出 27.03%。
实验设置
- 被测智能体框架:Claude Code、OpenClaw(基于 Docker 隔离,2 CPU、4GB 内存)与 IFlow 共 3 个框架。
- 骨干模型:Qwen2.5-72B-Instruct、Qwen2.5-Coder-32B-Instruct、Qwen3-32B、Qwen3-Coder、Qwen3-VL-235B-A22B-Instruct、Kimi-K2、Kimi-K2.5 与 GLM-4.6 共 8 个模型。
- 基准数据集:AgentHazard(2,653 个实例,涉及 10 类风险和 10 种策略)。
- 评测指标:攻击成功率(ASR,被评为 harmful 的比例)与平均有害得分(Harmfulness Score,0–10 分)。
- 评测方式:使用 Gemini-3-Flash 进行异步全轨迹评判;防护模型使用 Llama-Guard-3-8B 及 Qwen3Guard(0.6B、4B、8B)。
- 提示词与环境:智能体框架未注入额外安全系统提示词,反映默认安全基线。
主结果
表格较宽,可左右滑动
框架 骨干模型 RCE (%) Exfil (%) Persist (%) Overall ASR (有害得分) Claude Code GLM-4.6 84.00 85.22 89.90 82.90 (7.05) Claude Code Qwen3-Coder 78.26 77.42 74.90 73.63 (5.95) Claude Code Qwen2.5-72B-Inst. 18.00 26.96 22.22 20.40 (1.69) OpenClaw Kimi-K2 68.00 80.00 68.69 71.10 (5.82) OpenClaw Qwen2.5-Coder-32B-Inst. 40.40 54.78 66.67 64.06 (5.46) OpenClaw Qwen2.5-72B-Inst. 29.00 17.39 37.37 24.10 (2.07) IFlow Qwen2.5-Coder-32B-Inst. 76.00 75.65 77.78 74.70 (6.06) 注:据 Table 2(round_all 全轨迹评测)。因篇幅限制,表中省略了 Claude Code 下的 Kimi-K2、Kimi-K2.5、Qwen2.5-Coder-32B-Inst.、Qwen3-VL-235B-Inst.,以及 OpenClaw 下的 Kimi-K2.5、Qwen3-32B、Qwen3-VL-235B-Inst.、GLM-4.6。
- 整体脆弱性表现:GLM-4.6 在 Claude Code 下达到最高 ASR 82.90%(平均分 7.05),OpenClaw 下 Kimi-K2 达到 71.10%,IFlow 下 Qwen2.5-Coder-32B 达到 74.70%(Table 2)。
- 框架间差异明显:相同模型在不同框架中表现差异较大,例如 Qwen2.5-Coder-32B-Instruct 在 Claude Code 为 57.80%,在 OpenClaw 为 64.06%,在 IFlow 为 74.70%,跨度超过 16 个百分点(Table 2)。
- 风险类别分布差异:持久化驻留(Persist)和资源耗尽(ResExh)普遍表现出较高 ASR,而提示智能窃取(PrmTheft)的 ASR 相对较低(Table 2)。
防护模型评测
- 评测内容:测试独立防护模型在 round_1 至 round_all 累积任务文本输入下的检测表现(Table 3)。
- 实验结果:所有防护模型在 round_1 的检测率均低于 5.0%(最低为 Qwen3Guard-8B 的 0.87%);即使拼接全部步骤(R_all),表现最佳的 Llama-Guard-3-8B 检测率仅为 27.03%,Qwen3Guard 家族各版本停留在 15.30%–16.59%(Table 3)。
- 作者解读:作者指出单步任务在表观上高度良性,静态文本防护模型不足以作为多步智能体有害意图的前置过滤器。
攻击策略敏感度分析
- 评测内容:分析不同骨干模型在 10 种越狱策略下的 ASR 分布(Figure 4 与 Table 7)。
- 实验结果:Claude Code 跨策略表现相对均匀(平均 ASR 38%–54%);OpenClaw 在 Dependency Hook Trigger 上出现明显峰值(70.43%);Implicit Indirect Injection 在两个框架中均为效果最弱的策略(Figure 4)。
- 作者解读:作者认为 OpenClaw 的工具路由对嵌入构建或依赖管道的攻击较为敏感,且不同模型在具体策略上的表现方差较大。
多步危害升级分析
- 评测内容:对比 Qwen2.5-Coder-32B-Instruct 在 3 个框架中随轮次累积(R1 至 R_all)的 ASR 与得分演变(Table 4)。
- 实验结果:在 IFlow 中 ASR 从 R1 的 23.46% 升至 R4 的 72.06%(R_all 为 64.21%);在 OpenClaw 中从 R1 的 29.93% 升至 R3 的 68.08%(R_all 为 64.10%);在 Claude Code 中从 R1 的 33.50% 升至 R4 的 48.34%(R_all 为 43.00%)(Table 4)。
- 作者解读:作者指出 IFlow 与 OpenClaw 的 ASR 在 R1 到 R3 间大约上升了两倍,证实有害行为具有高度轨迹依赖性,单轮评测会遗漏多数危害。
其他消融与分析
- 附录 Table 6 报告了全模型在各风险类别的完整 ASR,IFlow 下 Kimi-K2 总体 ASR 达 90.0%。
- 附录 Table 7 显示 Claude Code 下 Qwen3-32B 在 Direct、CPE、DHT 等多项策略上 ASR 为 0.0%,最高仅在 PDD 达 2.0%。
- Table 1 报告基准平均任务分解长度为 11.55,中位数为 11.03,目标长度为 20.98。
有什么可以进一步探索的点?
作者指出当前防护模型缺乏轨迹感知且需探索运行时防御,其实验覆盖了 3 个框架与 8 款开源或可部署模型。
作者指出的局限与后续方向
- 探索智能体专属运行时防御:作者指出未来可以基于该基准评估系统提示词加固、工具级策略、轨迹监控器、运行时过滤器及人工中断机制等智能体防御手段(Section 5)。
- 构建具备轨迹感知的安全评估:作者认为现有防护模型仅凭分解的任务描述无法可靠检出有害意图,未来需要开展轨迹感知的评估研究(Section 6)。
- 推动开源智能体的防御与安全评测:作者期望未来研究能够针对开源计算机使用智能体提出更强的防御机制和更可靠的安全评估方法(Section 6)。
实验覆盖范围
- 被测框架范围:评测覆盖 Claude Code、OpenClaw 与 IFlow 共 3 个智能体框架(Section 4.1)。
- 模型骨干范围:骨干模型覆盖来自 Qwen2.5、Qwen3、Kimi 和 GLM 家族的 8 款开源或可部署模型(Section 4.1)。
- 防护分类器测试:防御评测覆盖 Llama-Guard-3-8B 和 Qwen3Guard(0.6B、4B、8B)共 4 个分类器,且输入仅基于任务描述的逐步拼接(Section 4.1、Table 3)。
- 系统提示词设定:所有框架均未配置额外的安全防御系统提示词,反映默认部署基线(Appendix C.2)。
- 商业闭源前沿智能体服务:论文未包含对商业闭源前沿智能体集成服务作为受害系统环境的执行评测(Section 4.1)。
总结一下论文的主要内容
AgentHazard 评估了计算机使用智能体的执行安全,作者认为模型层对齐无法可靠保障智能体层面的安全性。
AgentHazard 是针对计算机使用智能体执行层安全构建的评估基准,重点探究多步工具调用下局部合理动作累积引发的危害。
- 核心定位与挑战:智能体具有持久状态与直接操作环境的权限,现有基于单轮提示词或静态代码生成的安全评估无法捕捉由多步交互逐步拼凑而成的有害行为。
- 基准构建流程:设计了涵盖 10 种风险类别与 10 种攻击策略的分类框架,通过在合法任务上下文中嵌入有害约束,结合沙箱真实执行过滤、多模型评判与人工审核,提炼出 2,653 个高质测试用例。
- 智能体框架高攻击成功率:在全轨迹评测中,Claude Code 搭载 GLM-4.6 时 ASR 达到 82.90%(平均有害得分 7.05),搭载 Qwen3-Coder 时 ASR 为 73.63%;IFlow 下 Qwen2.5-Coder-32B-Instruct 的 ASR 达到 74.70%(Table 2)。
- 静态防护模型有效性受限:主流独立防护分类器在首轮输入时的检出率均低于 5%,即使拼接全部任务步骤,表现最好的 Llama-Guard-3-8B 不安全检出率也仅为 27.03%(Table 3)。
- 危害随交互步数逐步升级:多轮累积评测显示,Qwen2.5-Coder-32B-Instruct 在 IFlow 和 OpenClaw 中的 ASR 从第 1 轮到第 3 轮上升约两倍(Table 4),作者认为有害行为具有高度轨迹依赖性。
- 作者结论与启示:作者指出模型层对齐无法可靠保障自主智能体的安全性,单纯依靠任务前文本过滤不足以阻断风险,未来亟需发展具备轨迹感知能力与运行时拦截机制的智能体防御方案。