跳到正文
原文
LessWrong·本站收录 · 原文发表

研究笔记:从预训练数据中过滤绕过监督相关信息

Research Note: Filtering Subversion-Relevant Information from Pretraining Data

AI 导读

Geodesic 与 Redwood 的作者介绍了从零预训练 30B 模型时过滤绕过监督相关知识的初步研究。作者称过滤后知识题表现下降,而一般能力保持。作者明确表示尚未测试真实的绕控行为是否因此减少。

阅读原文lesswrong.com