跳到正文
原文
Joe Carlsmith· Joe Carlsmith·· 2025-09-23

Joe Carlsmith 谈如何赋予 AI 安全的动机

Video and transcript of talk on giving AIs safe motivations

AI 导读

Joe Carlsmith 在 UT Austin AI and Human Objectives Initiative 的演讲中,把 AI 对齐问题拆成两个核心前提:超级智能 AI 智能体可能强大到足以永久且非自愿地剥夺人类权力,且它们可能有动机这么做。他聚焦第二个前提,即如何从技术层面防止 AI 形成这种动机,重点讨论 AI 系统的动机、选项评估与监督约束,并指出哲学、语言学等学科可贡献的研究方向。

阅读原文joecarlsmith.substack.com