跳到正文
原文
The Midas Project·本站收录 · 原文发表 日期未标

Midas Watchtower 指 Anthropic Opus 5.5 有害操纵评估结论不明确

Midas Watchtower: Anthropic, Minor Concern on Sep 22, 2026

AI 导读

The Midas Project 新推出的 Watchtower 项目跟踪 AI 公司安全政策的变化与违背情况,其首篇记录聚焦 Anthropic 近期发布的 Claude Opus 5.5 及 230 页 System Card。System Card 显示,Anthropic 针对有害操纵的 Tier 2 风险评估结果为不明确,公司表示不认为 Opus 5.5 已越过 Tier 2 阈值,但披露该模型在影响力行动评测上的得分落在与 Tier 2 阈值相关的区间内,并称该评测本身持续呈现饱和。Anthropic 的判定依据是模型对真实人群的有效性尚未被确立。

阅读原文themidasproject.com