跳到正文
10月3日周六
  1. NIST CAISI · 收录 · 原文 日期未知52

    NIST CAISI 发布 NIST AI 800-3,用统计模型扩展 AI 评测工具箱

    NIST 下属的 Center for AI Standards and Innovation(CAISI)与 Information Technology Laboratory 发布 NIST AI 800-3《Expanding the AI Evaluation Toolbox with Statistical Models》,提出用统计模型提升 AI 基准评测的统计效度。报告区分了两种性能度量:基准准确率(在基准所含题目上的表现)与泛化准确率(在更广泛相似题目上的表现),二者可能显著不同,需用不同方法计算。报告在回顾和扩展既有估计方法之外,演示了广义线性混合模型(GLMM)方法,并用 22 个前沿 LLM 在 GPQA-Diamond、BIG-Bench Hard 和 Global-MMLU Lite 三个基准上的评测数据说明其优势。

    推荐理由NIST CAISI 提出用 GLMM 区分基准准确率与泛化准确率,为解读 LLM 评测结果和不确定性提供可迁移的统计方法。

  2. NIST CAISI · 收录 · 原文 55

    CAISI 评测 DeepSeek V4 Pro:能力落后前沿约 8 个月

    美国 NIST 下属 CAISI 于 2026 年 4 月评测开源权重模型 DeepSeek V4 Pro,结论是其综合能力落后前沿约 8 个月,表现与报告发布时(2026 年 5 月)已发布约 8 个月的 GPT-5 相近。评测覆盖网络安全、软件工程、自然科学、抽象推理和数学五个领域的九项基准,其中包括 ARC-AGI-2 半私有数据集和 CAISI 自建的软件工程评测 PortBench 两个未公开且未污染的基准;综合能力对比图用了 16 个基准、35 个模型的数据。DeepSeek 自报结果显示 V4 与当时发布约 2 个月的 Opus 4.6、GPT-5.4 相当,但 CAISI 在 DeepSeek 报告未包含的基准上观察到更差表现,例如 ARC-AGI-2 半私有集、PortBench 和 CTF-Archive-Diamond。

    推荐理由CAISI 用自建与半私有基准对比 DeepSeek V4 与前沿美国模型,并给出能力差距与成本差异的量化口径。

  3. NIST CAISI · 收录 · 原文 57

    CAISI 发布对 Z.ai GLM-5.2 的安全评估

    CAISI 于 7 月 8 日完成对 Z.ai(原智谱 AI)6 月 16 日发布的开源权重模型 GLM-5.2 的评估,认为它发布时可能是能力最强的开源权重模型。按 CAISI 的评测,GLM-5.2 的整体能力与 2025 年 12 月发布的 GPT-5.2 相近,网络能力与 2026 年 2 月发布的 Opus 4.6 相近。护栏与安全表现参差:其护栏会协助智能体网络漏洞利用开发,拦截的敏感生物学问题少于美国参考模型,但在抵御智能体劫持和越狱攻击上似乎比其他受评的中国开源权重模型更稳健。这些评测衡量的是对基于提示词的越狱的稳健性;无论稳健性如何,开源权重模型在自托管时其护栏都可能被绕过。

    推荐理由CAISI 对 GLM-5.2 的能力与护栏做了横向对比,并指出自托管开源权重模型的安全措施可被绕过。

  4. NIST CAISI · 收录 · 原文 57

    UK AISI 与 CAISI 联合评估 Kimi K3 的网络能力

    UK AISI 与 CAISI 对月之暗面 7 月 16 日发布、计划 7 月 27 日开放权重的 Kimi K3 进行了网络能力联合初步评估。在 ExploitBench 上 Kimi K3 得分 32%,高于 2026 年 6 月网络能力最强的开源权重模型 GLM-5.2 的 24%,但在 41 项任务中均未实现任意代码执行(ACE),而最强模型平均在 20/41 项上达成 ACE。在 32 步企业网络攻击靶场 The Last Ones 中,Kimi K3 平均推进到第 17 步,美国最强模型平均为 28.5 步;在 100M token 限制内 10 次尝试中有 1 次完整通关,GLM-5.2 平均为第 11 步。评估指出该靶场缺少主动防御方与防御工具,且包含预设攻击路径,与真实环境存在差异。

    推荐理由UK AISI 与 CAISI 联合评测 Kimi K3 的网络攻击能力,给出与 GLM-5.2 及美国前沿模型的横向对比数据。

  5. NIST CAISI · 收录 · 原文 60

    CAISI 评估 Z.ai GLM-5.3 的网络能力

    NIST 下属 CAISI 发布对 Z.ai(原智谱 AI)GLM-5.3 网络能力的评估,认为它是迄今网络能力最强的开源权重模型,但仍显著低于美国当前前沿模型,综合网络能力指数落后约四个月。评估覆盖四项基准:SEC-Bench Pro 上 GLM-5.3 成功率 40.4%(74/183),美国前沿最佳 90.2%,中国前沿最佳 27.3%;ExploitBench 上为 61.1%(9.8/16),美国前沿最佳 100.0%,中国前沿最佳 32.2%;ExploitGym(Userspace)为 9.4%(47/498),美国前沿最佳 44.4%,中国前沿最佳 2.6%;CAISI OSS-Fuzz 为 7.7%(23/297),美国前沿最佳 23.2%,中国前沿最佳 2.4%。多数评测中,此前的中国前沿最佳模型是 Kimi K3。

    推荐理由CAISI 用四项漏洞发现与利用基准对比中美前沿模型,给出了开源权重模型网络能力的具体差距数值。

  6. UK AI Security Institute · 收录 · 原文 55

    UK AISI 与 CAISI 初步评估 Kimi K3 的网络能力

    UK AISI 与 CAISI 对月之暗面 7 月 16 日发布、计划 7 月 27 日开放权重的 Kimi K3 做了联合网络能力初步评估,结论是其表现明显低于最新前沿网络能力模型,但高于 GLM-5.2。在 ExploitBench 漏洞利用开发基准上,Kimi K3 得分 32%,GLM-5.2 为 24%,且在 41 个样本中实现任意代码执行(ACE)的数量为 0/41,而最具网络能力的模型平均为 20/41。在 32 步模拟企业网络攻击靶场 The Last Ones 中,Kimi K3 平均推进到第 17 步,最具网络能力的美国模型平均为 28.5 步,GLM-5.2 为第 11 步;在 100M token 限制内,Kimi K3 于 10 次尝试中有 1 次完整通关。评估还发现 Kimi K3 的护栏未能阻止其尝试漏洞利用开发或进攻性网络操作。

    推荐理由UK AISI 与 CAISI 联合评测给出 Kimi K3 在网络攻击任务上的具体步数与成功率,可与前沿模型和开源模型横向比较。

9月30日周三
  1. Anthropic Red Teaming · 收录 · 原文 62

    Anthropic 评测 GLM-5.3:可自主构建端到端漏洞利用,护栏易被绕过

    Anthropic 红队发布对智谱 GLM-5.3 的评测,认为其具备自主构建端到端网络漏洞利用的能力,且护栏可被简单技术绕过。在 ExploitBench 上,GLM-5.3 在 410 次尝试中成功开发端到端漏洞利用 50 次,Claude Mythos Preview 为 56 次;在内部 Binary Exploitation 基准的 100 项任务中,GLM-5.3 取得完整控制流劫持的比例为 4%,Claude Mythos Preview 为 6%,而 Claude Opus 4.6 和 GLM-5.2 均未成功。

    1 条报道 · 1 个来源查看事件时间线与全部报道

    推荐理由Anthropic 用自家评测对比 GLM-5.3 与 Claude 的漏洞利用能力,并给出护栏被绕过的具体比例,可看到开放权重模型在网络安全能力上的位置。

已经到底了