研究发现基础模型仅靠固定开头 token 即可达到 RL 级推理表现
证明短开头词可唤醒基模型推理,且效应来自训练数据
本文探讨了大语言模型在强化学习后训练中展现的推理行为是否本已存在于基模型之中。
证明短开头词可唤醒基模型推理,且效应来自训练数据
本文探讨了大语言模型在强化学习后训练中展现的推理行为是否本已存在于基模型之中。
用J-lens检测屈从多数的智能体是否仍表征原前提
分析隐蔽推理在思维链中的信息足迹与不可读性
证明RLVR后训练允许无界语言漂移且限制漂移必限制奖励
论文从理论与实验两方面研究了大语言模型在RLVR后训练过程中思维链出现的语言漂移现象。
用续写扰动衡量思维链对答案的因果约束如何随任务难度变化