防御arXiv 2610.04299
R-Quest:用问题有效性与新颖性反馈维持推理模型自我进化
提出 R-Quest,用有效性与新颖性反馈维持推理模型自我进化
- arXiv
- 2610.04299
- 发表
- 场景
- 模型与 API
- 被测模型
- Qwen3-4B-Base、OctoThinker-3B-Hybrid-Base
摘要R-Quest 用有效性与新颖性反馈维持自进化。
R-Quest 处理的是推理模型自进化中的题目质量:questioner 与 solver 用 GRPO 交替从自生成题目学习时,多轮之后平均成绩会下降。