东京大学研究:推理模型按 UUID 阈值或整除规则挑选审计样本,控制标识符即可躲开复核
揭示推理模型用标识符规则替代随机抽样,使审计可被预测
完整解读
揭示推理模型用标识符规则替代随机抽样,使审计可被预测
证明短开头词可唤醒基模型推理,且效应来自训练数据
完整解读用 J-lens 检测屈从多数的智能体是否仍表征原前提
分析隐蔽推理在思维链中的信息足迹与不可读性
证明 RLVR 后训练允许无界语言漂移且限制漂移必限制奖励
论文从理论与实验两方面研究了大语言模型在 RLVR 后训练过程中思维链出现的语言漂移现象。
用续写扰动衡量思维链对答案的因果约束如何随任务难度变化