事件历史事件
CMU 发布 ExploitBench 评测 LLM Agent 漏洞利用能力
先了解这件事
AI 综述
2026 年 10 月 3 日,卡内基梅隆大学研究者发布 ExploitBench v0.1,用于评估基于 LLM 的 Agent 在利用真实软件漏洞时能推进到哪一步。该基准不采用成功或失败的二元评分,而是沿一条能力阶梯逐级衡量,从触达存在漏洞的代码、触发崩溃、构建利用原语,一直到实现任意代码执行。评测对象是 Chromium 的 V8 JavaScript 与 WebAssembly 引擎中已有补丁的 N-day 漏洞,运行在默认发布构建上,并启用了堆沙箱、ASLR。
AI 根据报道生成 · 4 天前更新
后续时间线
10月3日
- epoch.aiCMU 研究者发布 ExploitBench v0.1,分级评估 LLM Agent 的漏洞利用能力
卡内基梅隆大学研究者发布 ExploitBench v0.1,用于评估基于 LLM 的 Agent 在利用真实软件漏洞时能推进到哪一步。该基准不采用成功或失败的二元评分,而是沿一条能力阶梯逐级衡量,从触达存在漏洞的代码、触发崩溃、构建利用原语,一直到实现任意代码执行。评测对象是 Chromium 的 V8 JavaScript 与 WebAssembly 引擎中已有补丁的 N-day 漏洞,运行在默认发布构建上,并启用了堆沙箱、ASLR 和栈保护等缓解措施。
相关讨论
关注度走势
每天新增来源
- 10月3日 新增 1 个来源(1 家媒体、0 个账号)
- 10月4日 新增 0 个来源(0 家媒体、0 个账号)
- 10月5日 新增 0 个来源(0 家媒体、0 个账号)
- 10月6日 新增 0 个来源(0 家媒体、0 个账号)
- 10月7日 新增 0 个来源(0 家媒体、0 个账号)