Joe Carlsmith 谈自动化对齐研究:可评估的对齐研究更易被自动化
Video and transcript of talk on automating alignment research
AI 导读
Joe Carlsmith 在 Anthropic 的演讲中提出,解决对齐问题的关键之一是能否安全地自动化对齐研究,其中评估难度是核心障碍。他认为,可通过经验反馈回路与形式化方法评估的对齐研究更适合被自动化,并能反过来推动更难评估的"概念性对齐研究"。他同时强调,AI 安全反馈回路需在能力前沿推进的每个阶段跑赢或约束 AI 能力反馈回路。