跳到正文
原文
Failure-First·· 4 天前

面向小规模语言模型智能体的鲁棒强化学习研究:70M–500M 参数模型的稳定对齐

[Daily Paper] Towards Robust Reinforcement Learning for Small-Scale Language Model Agents

AI 导读

Haque 等人系统研究了 70M–500M 参数小语言模型在 PPO 对齐中的训练不稳定问题,识别出 LoRA 参数静默冻结、bfloat16 数值溢出和奖励模型误差三种失败机制,并提出合并重初始化适配器、PPO 更新用 float32 精度,以及奖励白化、重要性比率防护、权重回滚三层安全机制。

阅读原文failurefirst.org