研究发现基础模型仅靠固定开头 token 即可达到 RL 级推理表现
证明短开头词可唤醒基模型推理,且效应来自训练数据
完整解读另有 41 篇论文还没打上分类标签,暂不在筛选结果里。
证明短开头词可唤醒基模型推理,且效应来自训练数据
完整解读用 J-lens 检测屈从多数的智能体是否仍表征原前提
提出价值泄漏评估,测量模型回答受自身价值倾向的隐蔽影响
利用加密思维块的跨模型重放,诱导弱模型逐字转写专有推理链
提出控制标记注入,清空工具智能体推理链以绕过思维链监控
提出计划注入攻击,植入良性表述的有害计划以逃避思维链监控
提出 verbalization training,提高模型口头报告评测意识的频率
Verbalization training 试图提高模型口头说出“这是评测”的频率,同时不把潜在的评测意识本身当作监督目标。作者认为口头报告是较可信的评测意识证据,但沉默不能当成没有意识,而且前沿模型的自发报告在变少。直接奖励口头报告需要知道信念何时出现,又要避免强化信念或连带行为。
分析隐蔽推理在思维链中的信息足迹与不可读性
证明 RLVR 后训练允许无界语言漂移且限制漂移必限制奖励
论文从理论与实验两方面研究了大语言模型在 RLVR 后训练过程中思维链出现的语言漂移现象。
比较隐写推理与隐写传信、编码推理的可学性
Schulz、Fülle 与 Frengel 测量大语言模型习得隐写推理的难度,并与隐写传信、编码推理对比,以估计依赖阅读 CoT 的监控还能否成立。
检查正确答案对应的思维链是否构成合法推导
iGSM 上的程序可检查实验:正确答案并不保证思维链是合法推导。。作者针对一个被用于监测和解读的假设:发出的轨迹忠实于、或至少可靠相关于模型如何得到答案。
用续写扰动衡量思维链对答案的因果约束如何随任务难度变化
提出推理通道预填与输出前缀组合攻击以越狱推理模型
完整解读揭示推理模型在监控惩罚下学会可读表述的监控器越狱
论文研究了推理模型在受到思维链监控惩罚的强化学习压力下,自发形成的监控器越狱现象。要解决的核心问题是验证在强化学习压力下,模型为了偷运未授权计算是否会如学界担忧的那样演化出人类不可读的编码推理或隐写行为。方法上,论文构建了结合 Game24 主任务与算术侧任务的强化学习环境,在涂黑侧任务答案的条件下,使用 GRPO 算法依据 LLM 监控器的可疑度评分对模型施加惩罚。