跳到正文
原文
Anthropic Alignment Science·· 2 小时前精选关注度29

AE Studio 与 Anthropic 提出 GRAM:用模块化预训练隔离危险知识的初步研究

Modular Pretraining Enables Access Control

AI 导读

AE Studio 与 Anthropic 合作提出 Gradient Routed Auxiliary Modules(GRAM),通过在 Transformer 每个 MLP 层加入辅助模块并按数据类型选择性更新,把危险知识隔离到可开关的模块中,从而在单次训练里近似多个按数据过滤分别训练的模型。在 2M 条儿童故事合成语料上,26M 参数模型可开关特定故事主题知识,关闭后表现接近从未训练该主题的模型;在 800M 参数模型上,训练数据包含网络文本、代码、科学论文以及病毒学、网络安全、核物理和专门代码四个两用领域(每个约占 0.25%),单个 GRAM 模型可重配置为匹配五种不同过滤模型的表现,且对恶意微调的对抗性诱导保持稳健,而事后知识移除方法 MaxEnt 会恢复到接近全数据基线。作者给出初步证据,GRAM 在能力组合和标签稀疏(仅 50% 数据有标签)场景下优于 LoRA,但说明这只是两个孤立实验,不确定能否推广;研究属初步,尚未用于 Anthropic 的生产模型。

推荐理由

提出用梯度路由辅助模块把危险知识隔离到可开关的模块中,为按能力粒度做访问控制提供了一条单次训练的路径;作者说明研究是初步的,尚未用于生产模型。

阅读原文alignment.anthropic.com