跳到正文
原文
FAR.AI·本站收录 · 原文发表

FAR.AI 发布 2023 对齐研究进展:从 KataGo 对抗攻击到鲁棒性缩放律

2023 Alignment Research Updates | FAR.AI

AI 导读

FAR.AI 公布成立一年多来的对齐研究进展,其研究分为鲁棒性科学、价值对齐与模型评估三类。团队发现 KataGo、AlphaGo 等超人级围棋 AI 存在灾难性失效模式,正用机制可解释性方法分析其对抗攻击脆弱性,并探索语言模型鲁棒性的缩放律。该机构认为 RLHF 等现有对齐方法无法提供可证明的安全保证,目标是孵化早期阶段的安全研究议程。

阅读原文far.ai