跳到正文
原文
MIT Technology Review· Arthur Holland Michel·本站收录 · 原文发表

MIT Technology Review:我们过度依赖 AI 的拒答能力

We’re putting too much faith in AI’s ability to say no

AI 导读

MIT Technology Review 刊文指出,拒答已成为 AI 安全的承重墙,但这一机制本质上是概率性的,注定难以完全可靠。Anthropic 2021 年提出大语言模型应有用、诚实且无害,如今模型经红队测试与 AI 互训学会拒绝大量提示词,却仍保留作恶知识,能力与善意智能同步增长。文章称部分用户正试图用最先进 AI 培育生物病原体、构建自主无人机蜂群,而拒答边界由 AI 公司秘密划定,政府也将介入。

阅读原文technologyreview.com