研究重访奖励优化的缩放律:性能随偏好数据量与 KL 预算变化
Revisiting scaling laws for reward optimization
AI 导读
论文重新审视 AI 对齐中针对奖励模型优化的缩放律,提出性能大致按 Θ(√min{log(M),K}) 缩放,其中 M 是训练数据中的比较次数,K 是策略相对参考策略的 KL 散度预算。作者用信息论模型建立该上界,并证明可通过构造性过程紧致达到。实证部分采用真实标注设置,由 70B 金标奖励模型生成反馈数据,再用能力较弱的 0.6B 至 4B 模型训练代理奖励模型,缩放律拟合 R2 达 97% 至 99%,优于其他设定,并在不同模型规模、噪声和 best-of-N 或策略倾斜等优化方式下保持稳健。作者据此认为奖励优化类似于一个简单的选择任务,即依据带噪偏好反馈从一串独立同分布高斯随机变量中挑选。