跳到正文
原文
arXiv:对齐与欺骗· arXiv:2609.18642· Yajie Yu·· 15 天前

STRETCH:面向 LLM 渐进式进化的统一自教框架

STRETCH the Boundaries: A Unified Self-Taught Framework for Progressive LLM Evolution

AI 导读

针对固定难度导致 LLM 自我改进训练中能力停滞的问题,研究者提出统一框架 STRETCH(Self-Taught Reasoning Evolution via Targeted CHallenge),其动态 Stretch Zone 机制持续让问题难度与模型解题能力对齐。模型在单一参数空间内交替扮演生成边界挑战的 Scaffolder 与通过强化学习优化解题轨迹的 Learner,双循环共同进化可稳定训练、缓解奖励作弊并促进推理能力渐进增长。在谈判与运筹学基准上,STRETCH 持续优于强提示与领域专用基线;Scaffolder 配置分析显示动态难度对齐对能力持续提升与推理同步进化至关重要。

阅读原文arxiv.org