Anthropic 红队发布评估:AI 模型的情报定位与常规武器开发能力
Measuring tactical intelligence targeting and conventional weapons capabilities of AI models
AI 导读
Anthropic 前沿红队开发了一组评估,测量 AI 模型在战术情报定位(如依据碎片信息找人)和常规武器开发(如编写无人机打击移动目标的制导软件)上的能力,并称部分任务已达到过去只有稀缺专家才能完成的水平。在账号关联与人员分类任务上,Mythos Preview 表现最好,Kimi K3 在简单和中等样本上接近前沿,难度提高后落后。照片地理定位任务中,Mythos Preview 和 Mythos 5 的中位误差为 37.0 km 和 47.2 km,优于 GeoGuessr 冠军组 151 km 的人类基线;Opus 5 为 181 km,Sonnet 5 为 384 km,Kimi K3 为 385 km。文本地理定位任务中,至少一个模型能把 8% 的用户定位到 1 km 内,其中 70% 是因用户自己提到校园、场馆或街道等信息。
推荐理由
Anthropic 红队用仿真任务量化模型在情报定位与常规武器开发上的能力,并给出前沿与开源模型的差距。