跳到正文
事件持续更新

MIT Technology Review:AI 拒答机制的可靠性争议

1 篇报道1 个报道来源16 小时前更新

先了解这件事

AI 综述

MIT Technology Review 刊文讨论 AI 拒答机制。文章指出,拒答已成为 AI 安全的承重墙,但这一机制本质上是概率性的,注定难以完全可靠。Anthropic 2021 年提出大语言模型应有用、诚实且无害,如今模型经红队测试与 AI 互训学会拒绝大量提示词,却仍保留作恶知识,能力与善意智能同步增长。文章称部分用户正试图用最先进 AI 培育生物病原体、构建自主无人机蜂群,而拒答边界由 AI 公司秘密划定,政府也将介入。

AI 根据报道生成 · 16 小时前更新

后续时间线

10月9日
  1. MIT Technology Review
    MIT Technology Review:我们过度依赖 AI 的拒答能力

    MIT Technology Review 刊文指出,拒答已成为 AI 安全的承重墙,但这一机制本质上是概率性的,注定难以完全可靠。Anthropic 2021 年提出大语言模型应有用、诚实且无害,如今模型经红队测试与 AI 互训学会拒绝大量提示词,却仍保留作恶知识,能力与善意智能同步增长。文章称部分用户正试图用最先进 AI 培育生物病原体、构建自主无人机蜂群,而拒答边界由 AI 公司秘密划定,政府也将介入。

相关讨论

本站还没有收集到这件事的讨论链接。

关注度走势

每天新增来源

2 天共 1 个·最多 1(10月9日)·今天 0

  • 10月9日 新增 1 个来源(1 家媒体、0 个账号)
  • 10月10日 新增 0 个来源(0 家媒体、0 个账号)

每小时关注度

当前关注度 33·可比范围峰值 36(10月9日 18:00)·近 24 小时可比范围变化 –

01020304010月9日18:0010月9日23:0010月10日04:0010月10日09:00