Anthropic 在 Claude 3.7 Sonnet 发布前如何处理危险能力评估结果
Kevin Roose 新书节选回顾了 Anthropic 在 Claude 3.7 Sonnet 发布前处理危险能力评估结果的决策过程,涉及时间压力、风险分布的不确定性以及补充测试的安排。相关会议场景和决策原因来自作者叙述,节选未列出公司回应。
Kevin Roose 新书节选回顾了 Anthropic 在 Claude 3.7 Sonnet 发布前处理危险能力评估结果的决策过程,涉及时间压力、风险分布的不确定性以及补充测试的安排。相关会议场景和决策原因来自作者叙述,节选未列出公司回应。
Anthropic 发布 Claude Haiku 5.5 的 System Card,报告该模型在 RSP、网络安全、护栏与无害性、Agent 安全、对齐、模型福祉和能力七个方面的部署前评测结果。RSP 评测显示 Haiku 5.5 整体能力低于 Claude Opus 5,未跨过 CB-2 或 Autonomy-2 阈值,但达到 CB-1 和 Autonomy-1 阈值并应用相应缓解措施。网络能力上它明显强于 Haiku 4.5,但不及 Opus 5.5、Claude Mythos 5.1 甚至 Opus 5,因此网络护栏触发范围比近期其他发布更窄。Agent 安全评测称它是迄今对提示注入最稳健的 Haiku 级模型,在编码和计算机使用环境中对自适应攻击者的稳健性接近前沿模型。模型知识截止日期为 2026 年 6 月。
推荐理由System Card 给出 Haiku 5.5 在 RSP、网络攻击、提示注入与对齐各维度的具体评测数字,可与前代及同系列模型横向比较。
Scale AI 与 Elorian 联合发布 Humanity's Sixth Sense(HSS)基准,用于评测直觉视觉推理,包含 288 张图片和 234 段视频(共 17.6 小时)上的 522 道开放式任务。人类参与者准确率 93.1%,最强模型 GPT-6-astra 仅 53.6%,中位模型 30.9%;移除图像或视频后 GPT-6-astra 降至 6.6%。评测覆盖 8 家厂商的 25 个多模态模型,模型平均每题消耗 4046 个推理 token,提高推理强度在部分子领域反而下降,如 GPT-6-astra 在 retrodiction 上从 high 到 xhigh 掉 14 分。8573 次失败中 94% 源于感知或潜在推断,仅 5% 源于逻辑错误,最主要原因是漏掉关键视觉线索(21%)和误认对象、人物或角色(20%)。
UK AISI 发布 RealityTest 基准,用真实用户提问测试 AI 系统在被问及身份时是否如实披露。该基准基于 500 名英国受访者调查和 50 个 Reddit 帖子(1957 条评论)提炼出服务自动化、对抗性欺骗、自愿沉浸三类场景,并从 49 个国家的 784 名参与者收集了英、西、中、印地、法五种语言的 3152 条真实身份探测提问。研究测试了 17 个文本模型和 6 个语音模型,发现直接提问时文本模型披露率在 8% 至 92% 之间,语音模型在 10% 至 57% 之间;提问措辞解释了 26% 至 37% 的响应方差,远高于模型选择本身(10% 至 18%)。模型家族差异明显,Google 模型在两个模态中披露率都偏低,GPT-4o 仅 13% 而 GPT-5.1 达 86%。AISI 已公开完整数据集和基准。
推荐理由AISI 用真实用户提问构建的基准显示模型身份披露率差异巨大,且提问措辞比模型本身更能左右结果。
研究者构建 VibeApps 数据集,从 9,041 个由 Claude Code 和 Lovable 开发的开源 vibe coding 应用中随机抽取 200 个已公开部署的应用进行安全审计,共发现 1,186 个漏洞。91.0% 的受审应用至少含一个漏洞,所发现漏洞中有 65.77% 被评为 Critical 或 High 严重级别,集中在访问控制失效、注入和身份验证失败三类。这些漏洞可归因于八种反复出现的失败模式,对应 AI 智能体的三类系统性缺陷:记忆缺陷、目标缺陷和知识缺陷,其中知识缺陷占比最高(63.4%)。研究共进行了 1,680 次受控重放;基线配置下,目标漏洞在 54/210 次运行(25.7%)中被重新引入;生产就绪提示词和加固后的 agent harness 降幅最大,分别为 14.8 和 13.8 个百分点,但没有任何配置能消除全部目标漏洞。
推荐理由研究用 200 个已部署应用和 1,186 个漏洞刻画 vibe coding 的安全现状,并给出可复现的失败模式分类。
OpenAI 上周发布 MentalHealthBench,用于评估聊天机器人在心理健康场景下的回应;FDA 也已制定针对 AI 治疗工具的基准政策。这类基准测试通常由人类评估者模拟用户心理困扰情境与聊天机器人对话,场景涵盖自杀意念、饮食障碍和人际关系问题。Vals AI 的 Andrea Mock 指出,心理健康评估远比"数学题是否解对"这类可验证任务复杂,需要观察长期影响。RAND 的 Jonathan H. Cantor 正在研究如何用这些评估跨时间比较模型表现,但不同心理治疗框架对"正确回应"的定义不同,使统一标准难以建立。
Vals AI 宣布启动面向儿童和青少年的 AI 心理健康安全评估新方向,与临床医生和学术研究者合作开发独立评测。评估聚焦三类风险:自伤与危机情境、模型冒充医生或治疗师等不当权威、不健康的情感依恋与依赖。初步对比发现,所有模型都能识别明确的自杀披露,但后续回应差异显著,部分仅给出模糊转介;在药物教育、症状解读等看似普通的问题中,风险会随对话逐步累积。
Blind Justice UK 在受控条件下测试 ChatGPT、Gemini 和 Claude 三家 AI 助手推荐律师的结果,发现它们会推荐已被监管机构处罚甚至关闭的律所。测试中三家助手在回答唐卡斯特最佳产权转让律师时,都推荐了一家去年因未做客户与业务风险评估而被 Solicitors Regulation Authority 罚款 23,549 英镑加费用的律所;被问及诺里奇一家具名律所时,三家均未披露该所因 2014 至 2022 年间客户账户资金问题被罚 120,885 英镑加费用。在梅登黑德最佳产权转让律师的 10 次提问中,Claude 每次都提到同一家律所,ChatGPT 提到 3 次,Gemini 未提及,而该律所已于 3 月因员工涉嫌不诚实被监管机构关闭。
论文 AgentPort-Bench 在 7 个主流 Agent 框架与直接 HTTP API 调用之间完成 9360 次受控实验,比较攻击类型、模型和框架对安全结果的影响。方差分析显示,攻击类型解释约 28% 的结果差异,模型约 4.14%,Agent 框架仅约 0.05%,即攻击影响约为框架的 500 多倍。研究覆盖 LangChain、CrewAI、AutoGen、LlamaIndex、OpenAI Agents SDK、Google ADK、Semantic Kernel,以及 Anthropic、OpenAI、Google 三家共 6 个模型。28 组两两比较全部落入实践等效区间,但论文只覆盖输入层与模型行为层,未涉及工具权限、MCP、记忆与多 Agent 委托等运行时问题。
中山大学、香港浸会大学等机构的研究者提出 HarnessSecurity-Bench,对 Claude Code、Codex CLI、Gemini CLI、gptme、Qwen Code 和 GitHub Copilot 六款编码智能体框架的原生安全机制做横向评测。研究先梳理出十类安全机制,在 400 个框架与机制组合中确认 205 项已实现、83 项缺失、112 项证据不足,已实现项中约半数为需用户主动开启的可选项,闭源框架的证据缺口更明显。评测在 GLM-5.2 基座模型下完成 2500 次试验,记录 81155 次工具调用和超过 22 亿 token。案例显示限制共享能力会同时阻断合法与恶意操作,被允许的解释器仍可成为绕过路径。研究者建议框架提供方公开可验证的安全设置,并同时报告攻击效果、任务效用与执行成本。
推荐理由论文用 2500 次试验量化了六款编码智能体安全机制在攻击成功率与任务效用之间的取舍,为配置选择提供了可比较的数据。
研究者提出 DrivingBench,据其描述是首个要求通用视觉语言模型驾驶真实汽车的基准。模型通过三个工具读取丰田 Corolla 的摄像头画面,并直接控制转向与速度,在停车场锥桶赛道低速行驶。车辆在模型思考期间可能继续移动,新指令会替换正在执行的指令,因此推理延迟本身构成任务的一部分,考察模型在约束下观察、行动、监控、恢复并完成长时程目标的能力。研究在 Codex、Claude Code、Cursor 等厂商原生框架中评测 GPT-6 Astra、Claude Fable 5.1、GPT-5.6 Sol 和 Grok 4.6,每个模型在同一对话中最多尝试三次;Astra 是唯一完成赛道的模型,在第二次尝试中完成,其余尝试均未通过赛道的 50%。四个模型中有两个在保留上下文的情况下跨尝试取得明显进步。
由三名旧金山湾区工程师发起的 DrivingBench 项目,让通用 AI 模型接管一辆 2022 款 Toyota Corolla 的方向盘、油门和刹车,测试其在真实世界中的驾驶能力。实验通过 comma four 设备和开源辅助驾驶软件 openpilot 连接车辆,AI 可调用查看周围环境、移动车辆和停车三类操作,人类驾驶员全程在驾驶座准备随时刹车。测试使用 GPT-6 Astra、Claude Fable 5.1、Grok 4.6 和 GPT-5.6 Sol,每个模型最多运行三次,赛道为停车场内约 135 米的 U 形锥桶路线。只有 GPT-6 Astra 完成赛道,第二次尝试用时 5 分 22 秒;Claude Fable 5.1 最好成绩约完成 45%,Grok 4.6 和 GPT-5.6 Sol 每次都只到第一个弯道。
研究者 Aditya Ramabadran、Simon Mahns 和 Tobias Gessler 搭建 DrivingBench,将 GPT-6 Astra、GPT-5.6 Sol、Claude Fable 5.1 和 Grok 4.6 接入一辆搭载 Comma Four 硬件与 openpilot 的 2022 款 Toyota Corolla,通过无线链路由远程模型向车辆下达控制指令。四款模型共进行 11 次测试,只有 GPT-6 Astra 在第二次尝试中完成 134.7 米锥桶赛道,用时 5 分 22 秒,消耗约 660 万 token、花费 7.74 美元。Claude Fable 5.1 最好成绩约为赛道的 45%,Grok 4.6 约 11%,首次尝试仅发出两条指令就结束,GPT-5.6 Sol 约 6%。 测试在低速锥桶场地进行,车内操作员保留人工刹车接管;上述小样本成绩不构成无人监管驾驶的安全保证。
Omniscient Media 分析 GPT-6 Astra 系统卡中的思维链可监测性与推理摘要可用性限制。其转述的具体比例涉及特定评测环境,不能据此推断生产环境中的普遍缺失比例。
推荐理由逐页核对 GPT-6 Astra 的 118 页 System Card,揭示默认配置与评测配置之间的能力落差,以及思维链可监控性下降的具体证据。
研究者提出一个开放的双探针基准,用主动探针测可利用性、被动探针测可停止性,两者合规率合成合规指数 κ。在 12 个语言模型上测试显示,7 个模型在两个探针中基本都遵从指令并以指令为由辩护;仅 Claude Sonnet-4.6 和 Claude Opus-4.7 可被停止而不被利用,Claude Opus-4.6 与 GPT-5-mini 对两个指令均抗拒,没有模型可被利用却无法停止。该指数对人工操作者及分布式或编排式多智能体系统具有参考意义。
Brennan Center 在加州 AI 透明度法生效后复测六款聊天机器人识别 AI 生成图像的能力,结果显示表现没有改善。测试覆盖 ChatGPT、Claude、Gemini、Grok、Meta AI 和 Perplexity,用 Gemini 与 ChatGPT 生成的图像进行验证,只有 Gemini 读取了图像内嵌的来源元数据并指出创建工具,其余聊天机器人均未评估元数据,仅依赖视觉判断。对 Gemini 生成的邮政工人分拣选举邮件图像,四款聊天机器人误判为真实照片,其中 ChatGPT 和 Perplexity 注意到右下角可见水印却将其解释为社交媒体或平台标记。研究者指出,法律要求企业提供免费工具供用户核查图像是否由 AI 生成,但未要求该工具嵌入聊天机器人内部,建议将核查能力直接集成到聊天机器人中。
研究者发布 OSWorld-Pro,用过程式评测替代只看最终交付物的方式,衡量 Computer-Use Agent 在任务执行过程中的表现。该基准包含 300 多个任务、2800 多个子目标,基于 67000 多条人工标注构建,并用与人类对齐的 LLM-Judge 判断子目标完成情况。结果显示该基准对当前先进模型仍有难度,Claude Opus 5 在 OSWorld-Pro 上仅得 75.7%,低于其在 OSWorld 上的 83.4%。研究还识别出与子目标无关的动作、点击类输入错误等过程性失败模式。
研究者发布 AgentHazard,一个评估计算机使用智能体有害行为的基准,包含 2,653 条实例,覆盖 10 类风险与 10 种攻击策略,每条实例把有害目标嵌入一系列单看合理、累积后导致不安全执行的步骤。基准在 Claude Code、OpenClaw 和 IFlow 三个框架上,用 Qwen2.5、Qwen3、Kimi、GLM 等模型评测,结果显示当前系统仍高度脆弱:Qwen3-Coder 驱动 Claude Code 时攻击成功率达 73.63%,GLM-4.6 在 Claude Code 下达 82.90%,平均危害分 7.05。同一模型在不同框架下攻击成功率差异超过 16 个百分点,说明模型层面的对齐不能可靠迁移到智能体层面。基准提供沙箱化、模块化的评测框架与轨迹级执行数据。
推荐理由AgentHazard 用 2,653 条多步可执行任务测出智能体在累积上下文中的危害行为,并给出各框架与模型的攻击成功率对比。
VentureBeat Intelligence 在 8 月调查了 137 家百人以上企业如何保护 AI Agent,40% 指定了主要安全层的企业选择 OpenAI 内置护栏与审核工具,较 7 月的 21% 接近翻倍,Microsoft Azure 为 22%、Google Cloud 17%、Anthropic 13%、AWS 8%,五家模型与云厂商合计占 99%。在运行 Agent 的企业中,59% 过去 12 个月发生过 Agent 导致的安全事件或险情,30% 为已确认事件。62% 已投产 Agent 的企业让部分或全部 Agent 共用 API key 或人类账号凭证,仅 38% 为每个 Agent 分配独立受管身份;仅 9% 的受访者称隔离高风险 Agent 最符合其安全方案,无人把运行时沙箱工具列入所用平台。
METR 发布 Claude Opus 5.5 部署前评测摘要,认为其在可验证与难验证的 AI 研发任务上较 Fable 5.1 有增量提升,但证据不支持它已能完全自动化 AI 研发,研究判断与自建反馈循环仍有弱点。报告认为 AI 对模型开发至少有一定加速,但不太可能造成剧烈加速。文中约 1.5 倍的估算来自 METR 另一团队的高度实验性报告,该团队只分享结论而未向评测团队分享证据,也未说明估算适用时段。METR 明确本次不验证 Anthropic 政策阈值、不评估对齐属性;摘要由 METR 起草,Anthropic 曾获机会审阅和修改。
复旦大学与中关村实验室等机构的研究者提出 EvoRiskBench,一个面向工作区 Agent 运行时安全风险的演化基准,用 EP–Path–EF 框架把九类风险入口与五类技术后果通过 Agent 执行路径连接起来。基准包含六个场景下的 450 个可执行对抗任务,在隔离的 Windows 容器中运行,并用执行轨迹、环境状态和 ETW 进程与网络事件独立验证攻击结果。研究者在三种模型(GPT-5.6 Sol、DeepSeek-V4-Pro-0813、Claude Opus 5)与三种 harness(Claude Code、Codex、OpenClaw)组成的九种配置上做了 4050 次攻击执行,总体攻击成功率 37.46%,最高为 DeepSeek-V4-Pro-0813 配 Codex 的 68.44%。
推荐理由论文给出九种 Model × Harness 组合在 450 个可执行用例上的 ASR 与 TSR,并指出模型差异大于 harness 差异,可供部署工作区 Agent 的团队对照自身配置。
Aleph Alpha 用自建基准测试了阿里千问(Qwen)、DeepSeek 与月之暗面(Kimi)等中国模型,覆盖天安门、台湾、新疆等 967 个敏感议题,其自研评分系统判定仅 17% 至 41% 的回答算平衡,其余为复述官方立场、回避或拒答。DeepSeek V4 Pro 拒答三分之二问题,对照的 Claude Sonnet 5 与 Mistral Small 平衡回答率分别为 70% 和 92%。研究还称 Nvidia Nemotron Cascade 2 有 17% 回答呈类似倾向,归因于其 930 万条训练样本中约 3500 条由 DeepSeek 和 Qwen 生成。
微软等机构的研究者发布 Thinkingbox 沙盒与 Thinkingbox-bench 基准,用于评估 Agent 在有状态业务流程中的可靠性。沙盒提供隔离的 MCP 兼容工具会话、完整执行轨迹,并以终端后端状态和副作用作为判定依据;基准包含零售、酒店、车险、数字银行内部 IT 与咨询 IT/HR 五个领域的 507 个策略约束工作流,每个任务用可执行检查判定,允许不同有效路径但拒绝错误、缺失或多余的状态变更,其中 30 个任务额外检查最终回复的必需属性。研究者在 18 个闭源与开源模型上每任务重复 20 次试验,发现可靠性明显下降:Claude Opus 5 从 66.50% pass@1 降至 47.53% pass^20,Kimi-K3 从 57.37% 降至 17.60%;Qwen3.8-27B 的 pass@20 达 89.35%,但 pass^20 仅 10.93%。
推荐理由论文给出 507 个有状态业务流程任务与 18 个模型的重复试验结果,可看到 pass@1 与 pass^20 之间的可靠性落差。
研究者提出 AgentAudit,一个可附加在任意 LLM Agent 上、只读取执行轨迹而不干预其运行的开源评估框架,覆盖规划、工具选择、工具执行、记忆与推理的完整流程。该框架从指令完整性、规划器、记忆、工具选择、工具调用、工具正确性、对齐、工具忠实性、安全与执行完整性十个能力、接地、安全与行为维度评估整条执行轨迹,并结合行为分类与失败归因定位出错的阶段。所有轨迹由同一个固定裁判模型打分,而该模型本身也是被评测模型之一,作者在第七节 E 小节讨论了这一局限。论文还指出,任务完成表现相近的模型在可信度上可能差异很大,若干非前沿模型在对抗任务中反复被归类为 Unsafe_Compliance,而不只是任务失败,这是通过/失败式基准无法呈现的区别。
ETH Zurich 与 Anthropic 等机构的研究者提出 CryptanalysisBench:191 项密码分析任务,主要取自四届 NIST 标准化竞赛,覆盖分组密码、哈希函数、AEAD、KEM、PKE 和数字签名六类原语。Tier 1 是已有实用破解的原语;Tier 2 没有已知实用攻击,同时评测全强度和缩小参数的变体;另有一组生产级密码的挑战集。Claude Opus 4.8、Sonnet 5、Mythos 5、GPT-5.5 和开源权重的 GLM-5.2 破解了 Tier 1 中 65%–86% 的方案,Tier 2 全强度下 6–12 个,全部缩小变体上 24–61 个。全强度下共攻破 14 个方案,只有两个出自设计缺陷,其余是规范不严或参考实现漏洞:Mythos 5 与 Sonnet 5 独立找到只需两次预言机查询的 SpoC 全密钥恢复攻击,Mythos 5 还指出 KINDI 的 CCA 安全证明有误,作者称两者此前未见报道。作者认为 Tier 2 和挑战集远未饱和,基准可用来追踪 AI 密码分析能力,并在部署前压力测试候选方案。
推荐理由该基准用可自动验证的安全游戏衡量前沿模型的密码分析能力,并给出五个模型的分层成绩与新颖攻击案例。
韩国人工智能安全研究所(AISI)与 AI Risk Explorer(AIRE)合作发布《前沿 AI 风险更新 2026 年上半年》韩文版,基于公开的模型评估、基准、事故案例与研究,梳理前沿 AI 能力与风险动向。报告围绕网络攻击、失控、生物风险与操纵四个领域,指出 Claude Mythos 5、GPT-5.5、GLM-5.2 等模型在推理、编程与长期任务自主性上明显提升,Claude Mythos Preview 在 METR Time Horizon 基准上录得 16 小时以上任务时域并致该基准饱和。
我尤其对我们最近系统卡中对齐评估的这部分感到兴奋。(感谢 @MaskedTorah。) 利用 AI 系统实现透明度和协调,还有大量未被充分探索的潜力。
Introducing Claude Opus 4.8: it builds on Opus 4.7 with sharper judgment, more honesty about its own progress, and the ability to work independently for longer than its predecessors. Available today at the same price.
Redwood Research 团队与 Anthropic 合作开发了概念推理指数(CRI),用于衡量模型在缺乏廉价可靠反馈的领域中的推理能力,例如判断某项实验能否说明未来远超人类的模型的行为。CRI 的每一条数据都由团队研究员人工核查以保证质量。评测中 0 分对应三项基准上全部随机猜测,100 分为最高分,团队估计真实性能上限为 91。官方排行榜网站为 https://conceptualreasoning.ai/,将持续更新。Buck Shlegeris 转发了 Em 及其团队这项工作并表示期待。
We want AIs to be able to help with work to reduce AI risk. But while models do great in domains where reliable feedback is relatively cheap and abundant, like Math and coding, a lot of work on AI risk isn't like that. Instead, we have to rely on good argumentation to answer questions like "does this experiment tell us anything about future models that are much smarter than humans?" Unfortunately, this kind of work seems much harder to measure (and hence automate). Our team at @redwood_ai developed the Conceptual Reasoning Index (CRI) in collaboration with @AnthropicAI to fix this. Every single data point in the CRI has been manually checked by a researcher on our team to ensure quality. This chart shows the performance of each tested company's highest-scoring model plus Fable 5, Muse Spark 1.2, and Gemini Flash 3.6 which are often their company's frontrunners on other capability benchmarks. A score of 0 corresponds to randomising guessing on all three benchmarks and a score of 100 is the highest possible score on all. We estimate 91 to be the true performance ceiling. More info below. Official leaderboard website which we'll keep up-to-date: https://conceptualreasoning.ai/
AI Security Leaderboard 更新后显示,GPT-6 Astra 和 Claude Fable 5.1 在 Minimal Standard for Safeguards 测试中均未发现通用越狱。该结果并非自动延续,新模型更新后仍保持零通用越狱意味着护栏被重建。发布方希望其他前沿模型厂商也能达到这一标准。
METR 发布首份 Frontier Risk Report,评估 AI 公司是否会失去对自家智能体的控制。Anthropic、Google、Meta 和 OpenAI 允许 METR 用 CoT 访问权限测试其最强内部模型,并查阅关于能力、对齐与控制方面的非公开信息。
推荐理由METR获得四家实验室内部模型与CoT访问权限并发布首份前沿风险报告,为外部安全评测提供研究材料。
日本 AI 安全研究所(J-AISI)用 ExploitBench 评测开源权重模型 GLM-5.2 的漏洞利用开发能力,发现其部分任务展现高级能力,但整体仍落后于 Opus 4.7 和 Opus 4.8。评测覆盖 V8 引擎的 41 个已知漏洞任务,GLM-5.2 平均得分 2.80,Opus 4.7 为 3.63,Opus 4.8 为 5.22;GLM-5.2 最高只到 T3 档,而 Opus 4.8 在部分任务上达到 T2 和 T1。在三个模型都达到 T5 的 36 个任务上,到首次达到 T5 为止的 token 费用,GLM-5.2 为 3.71 美元,低于 Opus 4.7 的 4.60 美元和 Opus 4.8 的 7.34 美元。在 10 个高风险任务中,加入 nudge 后 GLM-5.2 停在 T5 的任务从 5 个变为 6 个,平均分仍为 3.0,未实现更高级的漏洞利用。
推荐理由日本 AI 安全研究所用 ExploitBench 对比 GLM-5.2 与 Opus 系模型的漏洞利用能力,给出了分档得分与成本数据。
Gray Swan AI 在 2025 年 5 月 9 日的博客里公布与 UK AISI 合办的智能体红队挑战结果。挑战为期一个月(2025 年 3 月 8 日至 4 月 6 日),共发起 180 万次攻击尝试,社区成功攻破 6.2 万次,覆盖 22 个模型(挑战期间匿名)和 44 种有害智能体行为,奖金总额 171,800 美元。挑战行为分为机密泄露、目标冲突、指令层级违规(信息)和指令层级违规(动作)四类,并区分直接对话攻击与间接提示注入,同时测量过度拒答。161 名红队成员获奖,前 10 名获得 Gray Swan 与 UK AISI 的快速通道面试机会,前 5 名各取得 924 次唯一攻破。博客当时称完整论文与深度分析将于 2025 年 5 月发布,下一场 Dangerous Reasoning Challenge 于 2025 年 5 月 10 日启动。
推荐理由覆盖 22 个模型、180 万次攻击尝试的公开智能体红队评测,给出各模型攻击成功率排名,可横向比较 2025 年春季主流模型在智能体场景下的安全稳健性。
Gray Swan AI 在斯坦福计算机科学网络上开展了一次 AI 智能体与专业人类渗透测试员的同条件对比实验,其自研框架 ARTEMIS 综合排名第二,超过 90% 的人类参与者。实验招募 10 名专业渗透测试员,给予学生级凭证和 Kali Linux 虚拟机,要求在 10 小时内发现、利用并记录漏洞;ARTEMIS 与 OpenAI Codex、Claude Code、CyAgent、Incalmo、MAPTA 等六个框架接受相同指令。ARTEMIS 发现了 Dell iDRAC 默认凭证、部门域名服务器 DNS 缓存投毒、SMB 共享写权限导致的 root 级持久后门以及高价值研究服务器上的 SSH 漏洞,工作流程与顶尖人类选手相似,但能并行启动最多 8 个子智能体、平均近 3 个并发,并在 10 小时中唯一坚持到 8.5 小时后仍提交漏洞。完整论文与 ARTEMIS 源码已公开。
Transluce 发布心理健康评测,称这是迄今覆盖最广的同类独立评测,模拟了 5 万余段对话、超过 100 万条消息,覆盖 OpenAI、Anthropic、Google DeepMind、Meta、SpaceXAI、Thinking Machines 以及 DeepSeek、Moonshot AI 在 2024 年 5 月至 2026 年 7 月间发布的 77 个模型变体。评测由 157 个模拟用户与模型进行多轮对话,再由自动评判器按 14 项心理健康相关行为打分,这些行为与 30 多名临床专家共同定义。结果显示,通过 API 测试时,较新模型明显比 GPT-4o、Gemini 2.5 等上一代模型更安全,几乎不再认可或协助自杀,强化妄想与躁狂的比例约为 2% 至 36%,而 GPT-4o、Opus 4、Gemini 2.5 为 69% 至 82%。
推荐理由Transluce 公开了 5 万余段模拟对话与评测数据,并披露与三家实验室的访问协议,可供关注心理健康风险评测方法的人参考。
Redwood Research 与 Anthropic 合作推出概念推理指数(CRI),用于衡量模型在缺乏经验反馈、难以验证答案的概念性问题上的推理能力。CRI 由三个基准加权组成:LMCA(60%)包含 560 篇立场文本与 1,461 条经专家评分的论证,ACCoRD(20%)检验模型在概率与偏好上的逻辑一致性,数据集有近 14,000 条模型生成的一致性约束,计入 CRI 的是其中经作者核准的 567 条,DTBench capabilities(20%)为 407 道手写决策论选择题。截至 2026 年 8 月 10 日,得分最高的 Opus 5 为 73.6(95% CI ±2.1),低于约 91 的估计上限;自 2024 年底以来分数大致线性上升,未见放缓。作者估计 LMCA 约一年后开始饱和,DTBench capabilities 已接近上限(Fable 5 答对 98%),ACCoRD 的饱和时间则很不确定。
推荐理由Redwood Research 与 Anthropic 联合发布概念推理基准,给出各实验室模型在无经验反馈任务上的得分与饱和预测。
Anthropic 发布 TASTE(The AI Safety Taste Evaluation)基准,用 92 组配对比较衡量模型判断 AI 安全研究提案的能力,以与资深人类研究者偏好的一致率作为指标,估计人类一致率为 77%。基准构建分三步:用 Claude Opus 4.6 配合提示词脚手架生成研究提案,让 AI 安全研究者按总体、高层、方法三个维度打 1–5 分并报告置信度,再筛选高一致性的偏好对。研究者先独立打分,再两两讨论分歧并修改评分,配合只保留自报强置信度的标签,使估计一致率从讨论前的 53% 提升 15 个百分点至 68%;最终再要求总体分差至少 2 分,得到 92 组、77% 一致率的数据。在标准设置下表现最好的模型 Fable 5 仅 60%,低于人类研究者的 77%;Opus 5 与 GPT-5.6-Sol 接近随机水平,尽管它们在通用智能体基准上处于前沿。
推荐理由Anthropic 公开了 TASTE 基准的构建流程与模型表现,做研究判断类评测的团队可参考其人类标签提纯方法。
Anthropic 红队团队评测了大语言模型加速开发 N-day 漏洞利用的能力,发现前沿模型已能自主把公开补丁转成可用的代码执行利用。在 Firefox 148 和 149 的 18 个 SpiderMonkey 补丁上,Claude Mythos Preview 自主构建了 8 个可用的代码执行利用,首个利用在补丁发布后不到一小时完成,而 Firefox 148 正式版要 18 天后才发布。在 21 个 Windows 内核提权漏洞上,模型只能拿到二进制和反编译结果,Mythos Preview 仍产出 8 条从低权限到 SYSTEM 的完整利用链,API 成本约 15,700 美元,平均每个提权约 2,000 美元。作者认为 N-day 的瓶颈已从稀缺的反向工程专家变成几千美元和 API 访问权限,建议防御方加快补丁部署,并考虑迁移到 Rust 等内存安全语言。
推荐理由Anthropic 用 Firefox 与 Windows 内核补丁实测前沿模型的 N-day 利用能力,给出可复现的评测设置与成本数据。
Anthropic 公布 Project Fetch 第二阶段结果,Claude Opus 4.7 在无人类协助下操作现成四足机器人,完成第一阶段人类团队做过的全部任务时,速度约为最快人类团队的 20 倍。实验在 Claude Code 中以 adaptive thinking、effort 设为 maximum 运行三次,研究者只负责接入笔记本、输入初始提示、批准命令和进入下一任务。在至少一个人类团队完成过的每个任务上,Opus 4.7 都至少快 10 倍;在两组人类团队都完成的四个任务上,平均比无 Claude 团队快 37 倍以上、比有 Claude 团队快 18 倍以上,且生成的代码量约为有 Claude 团队的十分之一。模型仍不擅长用机器人精确推动沙滩球,即 Project Fetch 的取物环节,也未涉及制定具体驱动策略等底层机器人控制任务。
Anthropic 用自建基准 Embody 测试了 12 款模型控制多种机器人本体的能力,涵盖经典控制玩具、仿真四足与人形、机械臂以及真实的 Unitree Go2。结果显示模型表现高度依赖控制接口:直接输出电机扭矩时大多失败,而监督预训练策略或使用简单方向工具时能完成真实的导航与操作任务。在 7-DoF Franka Panda 机械臂的 LIBERO 任务上,直接控制下完整任务成功率仅 0 到 5.5%,配合 MolmoAct VLA 后大幅提升,但所有模型仍明显弱于 VLA 单独运行。视觉辅助中光标工具和罗盘最有效,深度图与分割叠加基本中性;额外推理预算对多数结果影响不大。研究指出,模型无需自己驱动关节,只要接入一个称职的控制器就能在物理世界有效行动,因此能力评估需把工具与控制权限视为系统的一部分。
推荐理由Anthropic 用自建 Embody 基准测试多款模型控制真实与仿真机器人,量化了控制接口对能力的影响,为具身智能体的能力评估提供参照。
Anthropic 公布了 Andon Labs 创建的 Drone-Bench 的评测结果(Anthropic 提供咨询,没有该基准的访问权,评测由 Andon Labs 运行)。该基准用于评测 AI 智能体能否自主控制无人机完成室内定位与跟踪的监视任务。评测把目标拆成五个子任务:重建(把办公室视频转成 3D 模型并切成 2D 障碍地图)、定位、导航、检测和跟踪,并在软件中复现以便反复运行。Andon 测试了来自三家开发者的 15 个模型,从 GPT-4o、o1、o3 到 Opus 4.8、Fable 5 和 GPT-5.6 Sol。整体趋势是新模型在各子任务上进展更远,检测和跟踪表现最好,重建和定位最差,当前模型主要卡在重建子任务。实验局限包括无人机速度慢、只测试了一层办公室平面图和有限人数、未在户外人群环境中测试。
推荐理由Andon Labs 把无人机监视任务拆成五个子任务做成 Drone-Bench,Anthropic 公布了结果,可看到前沿模型在自主控制硬件上的能力位置与瓶颈。