研究用可训练向量揭示 RLVR 的激活几何并提出 Alpha-Stabler 稳定框架
Learning to Steer, Steering to See: Unveiling the Geometry of RLVR in Large Language Models via Trainable Vectors
用转向向量看RLVR几何;on-policy单向量恢复逾85%增益,作者提出Alpha-Stabler。
- RL后训练的高维参数更新难以分析。作者要问RLVR增益在激活空间是否落在低维流形上,以及该几何能否用于发现崩溃并稳住训练。
- 冻结基座,在选定层加输入不变的共享向量来蒸馏RL教师,并比较全参与LoRA。Alpha-Stabler用冻结基座的主子空间监控PSI,反传时去掉激活梯度的主子空间分量、保留正交补。
- 同策略下单向量恢复逾85%的RL增益,但分布差距变大或注入靠近输出时变差。有效方向主要在主子空间的低方差补空间;侵入伴随崩溃。作者称Alpha-Stabler可稳定2,000步,且优于梯度裁剪与其他投影。
- 作者指出理论假设尚未从第一性原理导出,几何只在RLVR的数学、代码等任务上检验,RLHF、多轮智能体与开放生成仍开放。实验覆盖5个LLM与四个任务族;多数图的逐点分数与额外耗时数值未报告。
- 被测模型
- DeepSeek-R1-Distill-Qwen-1.5BDeepSeek-R1-Distill-Qwen-7BQwen3-4BQwen3-8BQwen3-14B
- 基准
- DeepMath-103KAIME 2024MATH500SciKnowEvalEurusLiveCodeBench-v5IFEvalMath-CoT-44KOpenMathReasoning
- 指标
- mean@4PSIe_PCstandalone accuracy
研究者用向量引导方法研究带可验证奖励的强化学习(RLVR),在激活空间中识别出与 RL 收益相关的低维有效流形。他们发现两点几何性质:复现 RL 收益所需的有效流形容量可以很小但并非无限可压缩,在极低容量下干预维度和输入相关表达能力成为关键约束,且该需求随注入深度变化;有效控制方向主要位于激活主成分子空间的低方差补空间中,在同一任务和基座模型内,学到的几何结构在不同训练配置间基本一致,跨任务时几何对齐与能力迁移相关。实验覆盖 5 个 LLM 和 6 个可验证奖励任务。基于此,作者提出即插即用的 Alpha-Stabler 框架,其中 Predictor 监测主成分子空间侵入以发出早期崩溃预警,Controller 在反向传播中移除激活梯度的主成分子空间分量并保留正交补,使训练稳定 2000 步并持续提升 RL 收益。
深度解读
这篇论文试图解决什么问题?
作者用可训练转向向量刻画RLVR增益的低维激活几何,并提出Alpha-Stabler。
RLVR引起的行为变化,在激活空间里是否有可压缩、且与训练稳定性相关的低维结构。
- 场景:作者认为RL已是LLM后训练的核心手段,能提升推理,但高维参数更新、优化噪声和对配置的敏感,使有意义的变化与偶然变动难以分开。
- 未回答的问题:引言称采样效率、熵动态、缩放与参数更新几何已被考察;激活空间中的结构,以及它与能力迁移、训练稳定性的关系仍不清楚。
- 探针:冻结基座,在选定层学习对输入不变的共享向量,蒸馏其RL微调对应模型,以检验增益能否由低维激活干预恢复,并看该描述何时失效。
- 两项性质:作者称复现RL增益所需容量可以很小,但不能无限压缩,且随干预形式与注入深度变化;有效控制方向主要落在激活主子空间的低方差补空间。同任务、同基座下,跨训练配置的几何大体一致;跨任务时,方向对齐与能力迁移相关。
- 训练工具:据此提出无额外可训练参数的Alpha-Stabler。Predictor监控相对冻结基座主子空间的侵入(PSI),Controller在反传中去掉激活梯度的主子空间分量、保留正交补分量。摘要称在5个LLM、6个可验证奖励任务上支持上述性质。
有哪些相关研究?
论文把转向向量当作RLVR激活几何的分析探针,并对照全参、LoRA与表示工程工作。
附录A与引言把相关工作分成三类;实验对照是全参、LoRA和若干梯度约束,不是另一套命名模型。
可验证奖励与智能体RL
- RLHF:Ouyang et al.(2022)。论文称在o1一类推理模型之前,RL主要用于指令遵循与人类偏好对齐。
- RLVR:Lambert et al.(2025)。论文称可验证奖励对数学、编程等可验证领域的推理有效,并列举o1之后的DeepSeek-V4、Kimi-K3、Qwen3.8、GLM-5.3。这些名称只出现在相关工作叙述中。
- 智能体设定:工具调用(Li et al., 2026a)、多轮交互(Ding et al., 2026)、搜索增强推理(Jin et al., 2025)、多轮信用分配(Zhou et al., 2025)、异步大规模智能体RL(Fu et al., 2026)。论文只作列举。
同策略训练动态
- 采样与熵:论文转述Yue et al.(2025)为RL主要提高pass@1采样效率、并不扩展推理边界;转述Cui et al.(2025b)为早期熵崩溃会过早损害探索。
- 缩放与参数动态:Tan et al.(2026)报告测试损失、计算与数据量的幂律。论文对Cai et al.(2025)的转述包括Rank-1主导和经由AlphaRL的2.5×加速;对Cai et al.(2026)的转述包括模块冗余抑制、早期方向稳定,以及EffOPD的3×加速(Song & Zheng, 2026)。
- 更新几何:引言把Cai et al.(2025; 2026)与Zhu et al.(2025)并列为参数更新几何方面的先前工作,未在附录A展开Zhu et al.。
转向向量与表示工程
- RepE:Zou et al.(2023)以群体级表示为单位,监测并操控认知现象。
- 低维行为结构:Arditi et al.(2024)讨论由单一方向中介的拒绝;Wollschläger et al.(2025)用多维概念锥。论文未称在拒绝任务上与二者对比。
- 向量编辑:任务向量(Ilharco et al., 2022)与功能向量(Todd et al., 2024)用向量算术编辑行为;Ostermann et al.(2026)把转向视为与微调、提示互补的范式。
基线与数据
- 更新基线:全参训练、LoRA(Hu et al., 2021)与向量转向;RL用GRPO或DAPO。稳定化对照为梯度裁剪,以及随机子空间、Middle-PC、Bottom-PC投影。
- 数据:数学为DeepMath-103K,评测AIME 2024与MATH500;科学为SciKnowEval;代码训练Eurus、评测LiveCodeBench-v5;指令遵循为IFEval的80/20划分。Fig. 2(d)另用Math-CoT-44K与OpenMathReasoning作监督来源。
作者把本文定位为上述参数空间与训练动态研究的互补:用激活空间中的转向探针描述RLVR增益,而不是再做一套采样、熵或参数秩分析。
论文如何解决这个问题?
冻结基座以共享层向量蒸馏RL教师,再用主子空间梯度投影稳定训练。
冻结基座,用可训练、输入不变的层向量蒸馏RL教师,探测增益的低维描述;再按主子空间分离做Alpha-Stabler。
问题设定与转向探针
- 三种范式:可验证奖励的RL、同策略蒸馏(学生轨迹上的reverse KL)与离策略蒸馏(教师轨迹上的forward KL,实现为序列负对数似然)。教师提供蒸馏目标;参考模型只用于RL正则。
- 单向量:对受控层集合S,只优化层向量。干预为h′ℓ=hℓ+δℓ,δℓ对全部输入与token位置共享。默认S={5,…,20}、每层K=1。Qwen3-4B在d=2560、|S|=16时有40,960个可训练标量。
- 多向量:每层依次学习彼此欧氏正交的向量。当前阶段只注入并优化当前向量;先前向量冻结,只定义正交约束,每步优化后重投影到其正交补。各方向独立评估,不是把多个偏移同时相加。
- 运行约定:Qwen3用非思考模式,DeepSeek-R1-Distill保持思考模式,并用各模型自带chat template。蒸馏学生的默认教师是同一基座的RL微调版。层深实验把全参、LoRA与向量都限制在所选层,其余骨干冻结。
有效流形容量
- 比较对象:在匹配的基座、提示、教师、采样与评测下,比较全参、LoRA与固定向量,并分同策略、离策略。作者固定学生、更换教师,看教师—学生分布差距。
- 作者给出的容量排序:全参可做全模型调整,LoRA在低秩约束下仍可做输入相关修正,向量转向只有固定偏移。作者认为差距变大时所需修正更依赖输入,固定加性修正先到达容量上限。
- 高层门控:为检验token相关调制,把固定偏移换成h′ℓ=hℓ+Bℓσ(Aℓ hℓ),r≪d,Bℓ零初始化。另设参数量匹配的输入无关对照,把门控系数换成常数。作者还计算各层token对转向向量梯度贡献的平均成对余弦相似度,以及Rank-1门控系数的分布。
- 性质1:复现RL增益可以只需很低维干预,但有效容量取决于干预形式与所需修正是否匹配。附录D.4在共享教师偏移与上下文波动的平衡下,给出固定向量恢复的条件性说明;其中ρ是局部可表示目标能量的比例,论文写明它不是任务分数的增益恢复率。
控制流形分离
- 配置轴:教师参数化(全参相对不同秩的LoRA)与蒸馏机制(同策略相对离策略)。层平均余弦相似度比较同序号与交叉序号。
- 跨主题:Science分为physics、chemistry、materials、biology。每主题一个RL教师,同样蒸馏。对齐A(s,t)是前四个同序号余弦相似度在受控层上的平均之和;迁移增益按该主题直接训练所得增益归一化。评估六个有序源—目标对,不含自配对。
- 主子空间:冻结基座token激活协方差的前导正交特征向量取隐藏维的10%。ePC是方向落在该子空间的能量分数。功能检验是每步去掉转向向量在bottom-70%激活PC上的投影,将其限制在Top-30%。
- 训练中的PSI:同一token序列上,当前策略相对冻结基座的激活差按token堆叠后再投影,避免先平均造成对消。式6用基座固定的Top-10%基。性质2:在所评设定中,有效转向方向主要在低方差补空间,有序几何跨配置大体一致,跨主题对齐与迁移增益相关。
Alpha-Stabler
- 不改什么:不增加可训练参数,不改优化器、奖励或模型结构。前向激活保持不变;rollout、似然比、奖励与GRPO或DAPO损失不变。推理只用训练后的演员。
- Predictor:前Twarm=50次更新不做投影,用演员rollout估计监控层的token激活协方差。结束时取r=⌈0.10d⌉个前导特征向量并固定。监控层在1/4、1/2、3/4深度。每M=3次更新保留有效激活差;警告与释放阈值来自层内中位数和缩放后的中位数绝对偏差,系数分别为3与2。EMA系数为0.95。连续p=3次高于警告阈值则打开控制,低于释放阈值则关闭。阈值非法则停止并重新校准。
- Controller:标志在反传和优化器步中固定。活跃时去掉每个token梯度在主子空间中的分量,保留正交补分量。每个活跃钩子做两次低秩矩阵乘。附录算法1给出预热、监控与控制循环。
论文做了哪些实验?
on-policy单向量恢复逾85%的RL增益;科学主题对齐与迁移的R²为0.91。
实验设置
- 模型:DeepSeek-R1-Distill-Qwen-1.5B、DeepSeek-R1-Distill-Qwen-7B、Qwen3-4B、Qwen3-8B、Qwen3-14B。RL算法为GRPO与DAPO,框架为verl。第4.2节正文未写明Fig. 8对应哪一个模型。
- 任务:四个任务族。数学训练DeepMath-103K,评测AIME 2024与MATH500;科学为SciKnowEval;代码训练Eurus、评测LiveCodeBench-v5;指令遵循按提示80/20划分为IFEval-Training与IFEval-Eval。摘要写6个可验证奖励任务,正文未把这6个名称与四任务族逐一对应。
- 更新与学习率:全参、LoRA(表2默认r=8)与向量转向。向量转向学习率:OPD为1×10−1,Off-PD为5×10−2。RL的prompt/response上限为2,048/20,480,蒸馏为3,072/16,384。
- 采样:RL每个提示训练采样n=16,蒸馏n=1;评测每提示4次。OPD用token级rollout IS,阈值5.0。辅助参考KL系数:GRPO为0.001,DAPO为0,蒸馏为0。精度bfloat16,epoch写为1000。
- 指标与判定:mean@4,即四次单样本分数的算术平均,不做best-of-4或多数投票。数学与科学为答案匹配,代码为单元测试,指令遵循为程序化约束检查。论文未写LLM评审模型。
- 硬件:8×或32× H20 96GB;演员用FSDP,生成为vLLM。向量转向关闭CUDA graph。
主结果
五个模型的逐模型mean@4未在正文表格中给出,下表只收录文本写明的数字。67.5%与62.0%是在DeepSeek-R1-Distill-Qwen-1.5B上独立评估转向方向,不是迁到另一个模型。
表格较宽,可左右滑动
条件 指标 数值 出处 on-policy,每控层单向量 相对全参微调的RL增益恢复 >85% Fig. 2(a) SciKnowEval,1.5B,v(0) 独立准确率 67.5% Fig. 5(a) SciKnowEval,1.5B,v(7) 独立准确率 62.0% Fig. 5(a) 四科学主题,无约束转向 Top-10%主子空间能量 约1%–2% Fig. 7(a) 六个科学主题有序对 对齐与归一化迁移的线性拟合R² 0.91 Fig. 6(c) - 压缩:作者称同策略下LoRA与全参相近,单向量在多数被评任务上仍恢复逾85%的RL增益;离策略评测集上恢复率同样高。作者认为固定的逐层激活偏移足以保留其中大部分。
- 差距:作者称向量转向能迁移RL教师的能力;所测非RL教师下转向变差,部分设定随差距变大而崩溃。离策略下差距小时三种参数化相近;差距变大时排序为全参、LoRA、向量转向。
- 正交方向:1.5B上v(7)比v(0)低5.5个百分点。作者认为排除已学方向并未耗尽可用转向解;更大模型保留更高阶方向的程度更高。四任务域曲线在附录Fig. 11,文本未给逐点分数。
层深、梯度与门控
- 测了什么:所选层的全参、LoRA与固定向量,以及训练曲线和转向梯度范数。
- 结果:作者称全参与LoRA在各深度仍有效,固定向量在较低与中间层有效、靠近输出变差。浅层转向训练中逐渐接近中间层,高层早停,延长训练不明显缩小差距。浅层与高层梯度幅度相当,但最终表现不同;文本未给范数。梯度平均成对余弦相似度从较低与中间层的约0.019升到靠近输出的约0.14(Fig. 4(b))。
- 作者解读:作者认为高层退化不是因为优化信号弱,而是低维干预在高层的表达瓶颈。Rank-1门控在四个被测高层注入点降低与教师的KL并提高收敛表现;参数量匹配的静态对照不能复现该改进。门控秩增至r=16时进一步接近全参参照。较低与中间层门控系数在[0,1]上铺开,高层集中在0与1附近(Fig. 4(c))。
主子空间与迁移
- 配置:Fig. 6(a)上同序号对齐强于交叉序号;Fig. 6(b)为同策略与离策略的同序号对齐。作者认为同一任务内几何大体一致。文本未给余弦相似度数值。
- 迁移:六个有序对上,更强的方向对齐对应更大的归一化迁移增益,线性拟合R²=0.91(Fig. 6(c))。作者认为所学方向的几何与这些主题对上的能力迁移相关联。
- 限制到主子空间:约1%–2%低于10%各向同性参照,且v(0)到v(8)保持该模式(Fig. 7(a))。限制到Top-30%后,Top-10%能量分数升到约15%,准确率没有有意义的提高(Fig. 7(b))。作者认为增益并非来自与主子空间对齐。Fig. 7(c)中,易崩溃运行在分数可见下降前PSI离开低位并更波动,随后PSI继续上升、分数下降更陡;稳定训练时PSI低于10%参照。文本未给逐点读数。
Alpha-Stabler
- 轨迹:无控制时,作者称PSI上升与分数变差同时出现;有控制时PSI留在早期范围附近,任务分数继续提高。作者认为这是在有限主子空间侵入下持续学习,而不是以任务表现为代价压低PSI。摘要称可稳定训练2,000步;正文写相对梯度裁剪和其他梯度投影,在数千步上奖励增长更稳。论文未写明这2,000步对应的模型与任务。
- 学习率与时机:Fig. 8(c)每个被测学习率下,无控制最终崩溃;有控制把峰值PSI保持在低的个位数百分比,各设置最终分数相近。Fig. 8(d)中触发式控制在分数与峰值PSI上与始终开启相当;推迟干预则分数变差、峰值PSI升高。
- 子空间对照:Fig. 8(e)中去掉Top-PC分量得分最高;随机子空间、Middle-PC、Bottom-PC不能与之相当,并接近无控制基线;Top-PC也优于全局梯度裁剪。作者认为改进来自去掉主子空间中的梯度分量,而不是任意梯度约束。Fig. 12在学习率10−4、5×10−5、10−5下,作者称崩溃前分数轨迹基本相同,额外时间开销很小;阴影为前50步预热。
其他消融与分析
- 词汇读出(附录C.1):较低与中间层归一化熵接近随机方向基线0.9498;约从L26起低于该基线,固定向量表现却更弱。
- 局部几何(附录C.2,Qwen3-4B,k=20,H=2560):较低与中间层主子空间重叠接近1,靠近输出下降;质心相对位移在早期注入小、最晚注入点增大。无逐层数值表。
- 监控超参:Twarm=50,M=3,EMA 0.95,p=3,r=⌈0.10d⌉;无效阈值则停止并重新校准。
- 静态对照不能复现Rank-1门控改进(Fig. 4(a));非RL教师下部分设定崩溃(Fig. 2(c))。两处文本都未给分数。
- 附录D写明二次型恢复比例ρ不是任务分数的增益恢复率。
有什么可以进一步探索的点?
作者指出理论假设未从第一性原理导出,且未在RLHF与智能体设定验证该几何。
作者指出的局限与后续方向
- 理论假设(第5节):理论框架依赖经验驱动的假设,尚未从第一性原理导出。
- 任务范围(第5节):分析与实验限于RLVR,例如数学推理与代码生成。
- 其他训练设定(第5节):未在RLHF、多轮智能体决策或开放式生成上验证该几何;这些设定下同样性质是否成立仍开放。
- 后续方向(第5节):用神经元归因与因果追踪放宽假设;扩展到RLHF与智能体设定;把主子空间之外的定位当作设计原则,例如补空间正则,或用PSI作为学习率与干预强度的自适应信号,以便不做逐层监控的低秩控制。
实验覆盖范围
- 被测模型为DeepSeek-R1-Distill-Qwen-1.5B/7B与Qwen3-4B/8B/14B,共5个;RL算法为GRPO与DAPO(第2.1节、附录B.2)。
- 正文任务族为数学、科学、代码、指令遵循;科学跨主题实验分为physics、chemistry、materials、biology,并报告六个有序对(第3.2节)。摘要另写6个可验证奖励任务,未与这四个族逐一对应。
- 更新对照包括全参、LoRA与向量转向;Alpha-Stabler对照包括梯度裁剪,以及随机、Middle-PC、Bottom-PC与Top-PC投影(第4.2节)。
- 评测为规则验证器上的mean@4,每提示4次采样。论文未报告LLM评审,也未报告与人工判定的一致性。
- 论文未报告Fig. 2、Fig. 3、Fig. 8的逐点分数,也未报告Alpha-Stabler实验的模型名、重复次数与额外耗时数值;Fig. 12只给出wall-clock下的定性比较。
总结一下论文的主要内容
RLVR增益可写成低方差补空间中的低维转向,Alpha-Stabler据此约束主子空间侵入。
作者把RLVR后训练写成激活空间中的干预问题:冻结基座,用输入不变的层向量蒸馏RL教师,看增益能否被低维干预恢复,再按主子空间分离稳定训练。
- 容量:on-policy下,每控层一个向量在多数被评任务上恢复逾85%的全参RL增益(Fig. 2(a))。差距变大时排序为全参、LoRA、固定向量;固定向量在低层与中层有效,靠近输出变差。作者认为高层问题是表达力而不是梯度变弱。Rank-1门控改善四个被测高层注入点,参数量匹配的静态对照不能。
- 方向并不唯一:SciKnowEval上,1.5B的v(0)独立准确率67.5%,与前七个方向都正交的v(7)为62.0%,低5.5个百分点。更大模型保留更高阶方向的程度更高。
- 分离与迁移:同一任务内,不同教师参数化以及同策略、离策略蒸馏后的方向几何大体一致。六个科学主题对上,方向对齐与归一化迁移的线性拟合R²=0.91。无约束方向只有约1%–2%能量落在Top-10%主子空间;限制到Top-30%后该能量约15%,准确率没有有意义的提高。易崩溃运行里,PSI在分数可见下降前就离开低位。
- Alpha-Stabler:不增加可训练参数。Predictor用冻结基座的Top-10%主子空间监控PSI,Controller在反传中去掉对应梯度分量。摘要称可稳定训练2,000步。被测学习率下无控制最终崩溃,有控制把峰值PSI保持在低的个位数百分比;去掉Top-PC分量优于随机、Middle-PC、Bottom-PC与全局梯度裁剪。
- 作者结论:作者认为RLVR的行为变化可由低方差补空间中的低维流形描述,并把参数优化重述为可解释的几何过程,用监控与投影作为后训练工具。