评测与基准arXiv:2610.07639 · 10月6日HarnessSecurity-Bench 横向评测六款编码智能体框架的安全机制提出 HarnessSecurity-Bench,横向评测编码智能体框架的安全机制编程 Agent·测试GLM-5.2、Qwen3.8-27B、Claude Opus 4.8 等 4 个·应用层提示注入权限与沙箱+1+1完整解读
评测与基准arXiv:2604.02947 · 4月3日AgentHazard:评估计算机使用智能体有害行为的基准提出 AgentHazard 基准,评测计算机使用智能体的执行层有害行为网页与电脑操作编程 Agent·测试Qwen2.5-72B-Instruct、Qwen2.5-Coder-32B-Instruct、Qwen3-32B 等 12 个·应用层恶意使用摘要AgentHazard 评估了计算机使用智能体的执行安全,作者认为模型层对齐无法可靠保障智能体层面的安全性。AgentHazard 是针对计算机使用智能体执行层安全构建的评估基准,重点探究多步工具调用下局部合理动作累积引发的危害。完整解读