Anthropic 发布 Claude Opus 5.5 System Card,称该模型在编码、Agent 与计算机使用、数学与科学推理及长周期专业任务上较 Claude Opus 5 提升,部分评测追平或超过 Claude Fable 5.1 与 Claude Mythos 5.1。在 RSP 与 FCF 评估中,Anthropic 将 Opus 5.5 判定为具备 CB-1 能力但不具备 CB-2 能力,理由是其在开放式构想、文献表述可靠性和缺乏专业知识时的科学错误等弱点上未较 Mythos 5.1 改善,因此沿用与 Claude Fable 5 系列相同的扩展生物安全护栏。AI R&D 能力处于或略高于 Mythos 5.1,但远未达到替代其研究人员的水平,内部指标未显示持续的 AI 归因 2 倍开发加速,METR 外部测试结论一致。
Google DeepMind 宣布推出全球首个针对专有前沿级 AI 模型的双盲评测,把外部评测限制在密码学“盒子”内,避免测试题目被模型提前用于优化性能。该试点与新加坡 AI Safety Institute、OpenMined、AVERI 和 MLCommons 合作,在隐私保护环境中用保密基准测试一个 Gemini Flash Lite 模型。Google 表示,随着模型能力提升,确保模型未提前见过测试题目或提示词对评测可信度至关重要,基准污染会人为抬高分数并削弱政策制定者、研究人员和企业对评测的信任。此前外部测试提示词主要依靠零日志协议和合同保障保密,此次引入技术与密码学手段被视为安全模型评测的重要一步。