Joe Carlsmith· Joe Carlsmith·2025-05-01 02:14· 2025-05-01我们能否安全地自动化对齐研究?Can we safely automate alignment research?AI 导读Joe Carlsmith 在系列文章第五篇中探讨了安全自动化对齐研究的可行性,提出"对齐 MVP"概念,即让 AI 达到或超过顶尖人类专家的对齐研究水平。他认为可通过经验反馈回路和形式化方法评估的对齐研究最值得乐观,可先大量自动化这类研究,再借此安全地自动化其余"概念性对齐研究"。主要风险包括评估难题、AI 谋划和资源不足,但他认为仍有很大机会成功。阅读原文joecarlsmith.substack.com#对齐#观点/讨论#AI 控制#欺骗/谋划#Anthropic