跳到正文
原文
Vanity Fair·本站收录 · 原文发表

Anthropic 前沿红队发现 Claude 3.7 Sonnet 危险能力评估结果异常

“Sabotage, Lying, and Manipulation”: What One AI-Safety Company Found in the Dark Mind of a Rogue Chatbot

AI 导读

Anthropic 前沿红队在 Claude 3.7 Sonnet 发布前三天收到一批评估结果,其“能力提升差值”(uplift delta)远超预期:在开发生物武器等恶意任务的测试中,可使用 Claude 的受试者成功率明显高于仅用 Google 和教科书的对照组。按 Anthropic 2023 年发布的 Responsible Scaling Policy,该结果在部分极端场景下触及 ASL-3 阈值,团队需在三天内决定是否推迟发布。

阅读原文vanityfair.com