事件观察中
Midas Watchtower 质疑 Anthropic 有害操纵评测
先了解这件事
AI 综述
The Midas Project 新推出的 Watchtower 项目跟踪 AI 公司安全政策的变化与违背情况,其首篇记录聚焦 Anthropic 近期发布的 Claude Opus 5.5 及 230 页 System Card。System Card 显示,Anthropic 针对有害操纵的 Tier 2 风险评估结果为不明确,公司表示不认为 Opus 5.5 已越过 Tier 2 阈值,但披露该模型在影响力行动评测上的得分落在与
AI 根据报道生成 · 2 天前更新
后续时间线
日期未标
- 日期未标The Midas ProjectMidas Watchtower 指 Anthropic Opus 5.5 有害操纵评估结论不明确
The Midas Project 新推出的 Watchtower 项目跟踪 AI 公司安全政策的变化与违背情况,其首篇记录聚焦 Anthropic 近期发布的 Claude Opus 5.5 及 230 页 System Card。System Card 显示,Anthropic 针对有害操纵的 Tier 2 风险评估结果为不明确,公司表示不认为 Opus 5.5 已越过 Tier 2 阈值,但披露该模型在影响力行动评测上的得分落在与 Tier 2 阈值相关的区间内,并称该评测本身持续呈现饱和。Anthropic 的判定依据是模型对真实人群的有效性尚未被确立。
相关讨论
关注度走势
每天新增来源
- 10月8日 新增 1 个来源(1 家媒体、0 个账号)
- 10月9日 新增 0 个来源(0 家媒体、0 个账号)
- 10月10日 新增 0 个来源(0 家媒体、0 个账号)