跳到正文
原文
Joe Carlsmith· Joe Carlsmith·· 2026-01-30

如何构建能做人类式哲学的 AI:Joe Carlsmith 谈对齐中的哲学能力与倾向

Building AIs that do human-like philosophy

AI 导读

Joe Carlsmith 在系列文章第九篇中提出,AI 对齐需要构建能做"人类式哲学"的 AI,即能在反思后获得人类认可的方式将概念与实践推广到新情境。他把这一挑战拆成能力与倾向两方面:能力可能随 AI 进步默认获得,倾向才是最大担忧,本质上属于从 AI 中引出高质量"概念研究"的启发问题。由于人类式哲学(尤其是伦理)难以评估,这一领域可能需要格外细致的努力。

阅读原文joecarlsmith.substack.com