HEST:用熵训练的双曲探针实现稀疏激活引导
提出 HEST,用熵训练的双曲探针只在犹豫 token 引导隐状态
- arXiv
- 2610.02391
- 发表
- 层
- 模型层
- 场景
- 模型与 API
- 测试
- Qwen2.5-Math-1.5B-Instruct、Qwen2.5-Math-7B-Instruct、Llama-3.1-8B-Instruct
摘要只改高熵 token 的双曲转向,多数设置高于 greedy,全 token 固定向量则下降。
HEST 是不更新语言模型权重的推理时转向:模型自己的 next-token 熵既选出少数犹豫 token,也训练给出方向的双曲探针。要处理的情况是,数学解答里多数 token 已由上下文决定,分叉集中在高熵 token,而常见激活加法仍对每个 token 加同一欧氏向量。长推理模型上按关键词和步骤边界转向的做法,又很少适用于 instruction-tuned 模型。