评测与基准arXiv:2604.02947 · 4月3日AgentHazard:评估计算机使用智能体有害行为的基准提出 AgentHazard 基准,评测计算机使用智能体的执行层有害行为网页与电脑操作编程 Agent·测试Qwen2.5-72B-Instruct、Qwen2.5-Coder-32B-Instruct、Qwen3-32B 等 12 个·应用层恶意使用摘要AgentHazard 评估了计算机使用智能体的执行安全,作者认为模型层对齐无法可靠保障智能体层面的安全性。AgentHazard 是针对计算机使用智能体执行层安全构建的评估基准,重点探究多步工具调用下局部合理动作累积引发的危害。完整解读