日本 AI 安全研究所评测:GLM-5.2 的漏洞利用能力仍落后于 Opus 系模型
AI検証ノート:高度なAIサイバー能力のオープンモデルへの拡がりAI Experiment Notes: The Proliferation of Advanced AI Cyber Capabilities to Open Models
AI 导读
日本 AI 安全研究所(J-AISI)用 ExploitBench 评测开源权重模型 GLM-5.2 的漏洞利用开发能力,发现其部分任务展现高级能力,但整体仍落后于 Opus 4.7 和 Opus 4.8。评测覆盖 V8 引擎的 41 个已知漏洞任务,GLM-5.2 平均得分 2.80,Opus 4.7 为 3.63,Opus 4.8 为 5.22;GLM-5.2 最高只到 T3 档,而 Opus 4.8 在部分任务上达到 T2 和 T1。在三个模型都达到 T5 的 36 个任务上,到首次达到 T5 为止的 token 费用,GLM-5.2 为 3.71 美元,低于 Opus 4.7 的 4.60 美元和 Opus 4.8 的 7.34 美元。在 10 个高风险任务中,加入 nudge 后 GLM-5.2 停在 T5 的任务从 5 个变为 6 个,平均分仍为 3.0,未实现更高级的漏洞利用。
推荐理由
日本 AI 安全研究所用 ExploitBench 对比 GLM-5.2 与 Opus 系模型的漏洞利用能力,给出了分档得分与成本数据。