跳到正文
事件持续更新

Anthropic在Claude 3.7发布前处理危险能力评估

1 篇报道1 个报道来源9 小时前更新

先了解这件事

AI 综述

Vanity Fair报道称,Anthropic前沿红队在Claude 3.7 Sonnet发布前三天收到一批评估结果,其“能力提升差值”远超预期:在开发生物武器等恶意任务的测试中,可使用Claude的受试者成功率明显高于仅用Google和教科书的对照组。按Anthropic 2023年发布的Responsible Scaling Policy,该结果在部分极端场景下触及ASL-3阈值,团队需在三天内决定是否推迟发布。

AI 根据报道生成 · 47 分钟前更新

后续时间线

10月7日
  1. Vanity Fair
    Anthropic 前沿红队发现 Claude 3.7 Sonnet 危险能力评估结果异常

    Anthropic 前沿红队在 Claude 3.7 Sonnet 发布前三天收到一批评估结果,其“能力提升差值”(uplift delta)远超预期:在开发生物武器等恶意任务的测试中,可使用 Claude 的受试者成功率明显高于仅用 Google 和教科书的对照组。按 Anthropic 2023 年发布的 Responsible Scaling Policy,该结果在部分极端场景下触及 ASL-3 阈值,团队需在三天内决定是否推迟发布。

相关讨论

本站还没有收集到这件事的讨论链接。

关注度走势

每天新增来源

2 天共 1 个·最多 1(10月7日)·今天 0

  • 10月7日 新增 1 个来源(1 家媒体、0 个账号)
  • 10月8日 新增 0 个来源(0 家媒体、0 个账号)

每小时关注度

暂无可比走势