R-Quest:用问题有效性与新颖性反馈维持推理模型自我进化
Questioning the Questions: Sustaining Self-Evolution in Reasoning Models
AI 导读
研究分析自我进化推理模型在反复自训练中出现性能崩溃的原因,发现自生成问题存在两类质量缺陷:无效问题随训练轮次增多,基于答案一致性的过滤反而提高其在训练数据中的比例;基于词汇相似度的多样性控制无法识别表述不同但数学等价的问题,导致后期训练出现问题多样性崩溃。为此作者提出 R-Quest,先用问题有效性与新颖性反馈训练求解器识别并拒绝无效问题,再用其判断引导提问者奖励并过滤求解器训练数据,同时用冻结基模型比较采样问题对以提供新颖性反馈。该方法在两个模型族、12 个数学推理、通用推理和代码生成基准上取得最高平均性能,并在十轮自我进化中保持稳定提升,最后一轮达到峰值,比 R-Zero 高出 17.32 分。