FAR.AI 发布 2023 对齐研究进展:从 KataGo 对抗攻击到鲁棒性缩放律
2023 Alignment Research Updates | FAR.AI
AI 导读
FAR.AI 公布成立一年多来的对齐研究进展,其研究分为鲁棒性科学、价值对齐与模型评估三类。团队发现 KataGo、AlphaGo 等超人级围棋 AI 存在灾难性失效模式,正用机制可解释性方法分析其对抗攻击脆弱性,并探索语言模型鲁棒性的缩放律。该机构认为 RLHF 等现有对齐方法无法提供可证明的安全保证,目标是孵化早期阶段的安全研究议程。