MIT Technology Review:我们过度依赖 AI 的拒答能力
We’re putting too much faith in AI’s ability to say no
AI 导读
MIT Technology Review 刊文指出,拒答已成为 AI 安全的承重墙,但这一机制本质上是概率性的,注定难以完全可靠。Anthropic 2021 年提出大语言模型应有用、诚实且无害,如今模型经红队测试与 AI 互训学会拒绝大量提示词,却仍保留作恶知识,能力与善意智能同步增长。文章称部分用户正试图用最先进 AI 培育生物病原体、构建自主无人机蜂群,而拒答边界由 AI 公司秘密划定,政府也将介入。