事件持续更新
Anthropic在Claude 3.7发布前处理危险能力评估
先了解这件事
AI 综述
Vanity Fair报道称,Anthropic前沿红队在Claude 3.7 Sonnet发布前三天收到一批评估结果,其“能力提升差值”远超预期:在开发生物武器等恶意任务的测试中,可使用Claude的受试者成功率明显高于仅用Google和教科书的对照组。按Anthropic 2023年发布的Responsible Scaling Policy,该结果在部分极端场景下触及ASL-3阈值,团队需在三天内决定是否推迟发布。
AI 根据报道生成 · 47 分钟前更新
后续时间线
10月7日
- Vanity FairAnthropic 前沿红队发现 Claude 3.7 Sonnet 危险能力评估结果异常
Anthropic 前沿红队在 Claude 3.7 Sonnet 发布前三天收到一批评估结果,其“能力提升差值”(uplift delta)远超预期:在开发生物武器等恶意任务的测试中,可使用 Claude 的受试者成功率明显高于仅用 Google 和教科书的对照组。按 Anthropic 2023 年发布的 Responsible Scaling Policy,该结果在部分极端场景下触及 ASL-3 阈值,团队需在三天内决定是否推迟发布。
相关讨论
关注度走势
每天新增来源
- 10月7日 新增 1 个来源(1 家媒体、0 个账号)
- 10月8日 新增 0 个来源(0 家媒体、0 个账号)