事件持续更新
MIT Technology Review:AI 拒答机制的可靠性争议
先了解这件事
AI 综述
MIT Technology Review 刊文讨论 AI 拒答机制。文章指出,拒答已成为 AI 安全的承重墙,但这一机制本质上是概率性的,注定难以完全可靠。Anthropic 2021 年提出大语言模型应有用、诚实且无害,如今模型经红队测试与 AI 互训学会拒绝大量提示词,却仍保留作恶知识,能力与善意智能同步增长。文章称部分用户正试图用最先进 AI 培育生物病原体、构建自主无人机蜂群,而拒答边界由 AI 公司秘密划定,政府也将介入。
AI 根据报道生成 · 16 小时前更新
最新进展10月9日 17:00
MIT Technology Review 刊文指出,AI 拒答机制本质上是概率性的,注定难以完全可靠。后续时间线
10月9日
- MIT Technology ReviewMIT Technology Review:我们过度依赖 AI 的拒答能力
MIT Technology Review 刊文指出,拒答已成为 AI 安全的承重墙,但这一机制本质上是概率性的,注定难以完全可靠。Anthropic 2021 年提出大语言模型应有用、诚实且无害,如今模型经红队测试与 AI 互训学会拒绝大量提示词,却仍保留作恶知识,能力与善意智能同步增长。文章称部分用户正试图用最先进 AI 培育生物病原体、构建自主无人机蜂群,而拒答边界由 AI 公司秘密划定,政府也将介入。
相关讨论
关注度走势
每天新增来源
- 10月9日 新增 1 个来源(1 家媒体、0 个账号)
- 10月10日 新增 0 个来源(0 家媒体、0 个账号)