CAISI 评测 DeepSeek V4 Pro:能力落后前沿约 8 个月
CAISI Evaluation of DeepSeek V4 Pro
AI 导读
美国 NIST 下属 CAISI 于 2026 年 4 月评测开源权重模型 DeepSeek V4 Pro,结论是其综合能力落后前沿约 8 个月,表现与报告发布时(2026 年 5 月)已发布约 8 个月的 GPT-5 相近。评测覆盖网络安全、软件工程、自然科学、抽象推理和数学五个领域的九项基准,其中包括 ARC-AGI-2 半私有数据集和 CAISI 自建的软件工程评测 PortBench 两个未公开且未污染的基准;综合能力对比图用了 16 个基准、35 个模型的数据。DeepSeek 自报结果显示 V4 与当时发布约 2 个月的 Opus 4.6、GPT-5.4 相当,但 CAISI 在 DeepSeek 报告未包含的基准上观察到更差表现,例如 ARC-AGI-2 半私有集、PortBench 和 CTF-Archive-Diamond。
推荐理由
CAISI 用自建与半私有基准对比 DeepSeek V4 与前沿美国模型,并给出能力差距与成本差异的量化口径。