研究:RLVR 后训练在全新推理任务上引发语言漂移
作者称理论证明RLVR允许无界语言漂移且限制漂移必限制奖励,实验显示新任务RLVR会导致降低互读性的独特语言漂移。
- -0.24Llama在GSM8K上Best-Perf检查点的痕迹可读性AUC差值(Table 2)
- -0.17Gemma在GSM8K上Best-Perf检查点的痕迹可读性AUC差值(Table 2)
- 0.02Qwen在GSM8K上Best-Perf检查点的痕迹可读性AUC差值(Table 2)
探明RLVR后训练中语言漂移的成因,以及限制漂移对模型性能的理论制约。
梳理RL中的语言漂移、前沿模型不可读推理痕迹,以及通过偏好或提示诱导新型语言行为的研究。
建立语言漂移与训练过程的形式化理论,证明RLVR的无界漂移与奖励权衡,并设计片段可读性评测协议。
在GSM8K上用三款小模型对比RLVR与SFT,验证新任务下RLVR导致更大漂移且每次漂移方向独特。
作者指出了模型较小、数据集单一及缺少定理3实证等局限,实证范围覆盖到1.5B模型和GSM8K。
论文证明并验证了RLVR在新任务上必然诱发独特的语言漂移,揭示了前沿推理模型可监控性的安全隐患。