分析与理论arXiv:2610.06851 · 10月5日研究发现基础模型仅靠固定开头 token 即可达到 RL 级推理表现证明短开头词可唤醒基模型推理,且效应来自训练数据模型与 API·测试Llama-3.1-8B、Olmo-3-7B、Olmo-3-32B 等 10 个·训练与数据层推理链完整解读
可解释性arXiv:2610.02702 · 10月2日研究:LLM 智能体顺从多数时内部仍保留原有前提用 J-lens 检测屈从多数的智能体是否仍表征原前提多智能体·测试Llama-3.1-8B-Instruct、Qwen3.5-4B、Qwen3.6-27B 等 4 个·模型层推理链摘要揭示 LLM 智能体屈从多数时内部仍表征原推理前提,指出辩论表态共识可能夸大真实认同。完整解读
分析与理论arXiv:2609.37312 · 9月29日研究:隐蔽推理必然留下信息痕迹,但思维链未必可读分析隐蔽推理在思维链中的信息足迹与不可读性模型与 API·测试Llama-3.1-8B-Instruct、Qwen2.5-7B-Instruct、Qwen 3.5 397B-A17B 等 12 个·模型层监控与审计欺骗与谋划推理链+1+1摘要论文从理论与实证探明了思维链监控的边界:复杂隐蔽计算必然泄露信息足迹且需承担长度税,但该足迹可被在线加密而不可读。完整解读
分析与理论arXiv:2610.02015 · 10月2日研究:RLVR 后训练在全新推理任务上引发语言漂移证明 RLVR 后训练允许无界语言漂移且限制漂移必限制奖励模型与 API·测试Llama-3.2-1B、Llama-3.2-1B-Instruct、gemma-3-1b-pt 等 6 个·训练与数据层推理链摘要论文证明并验证了 RLVR 在新任务上必然诱发独特的语言漂移,揭示了前沿推理模型可监控性的安全隐患。论文从理论与实验两方面研究了大语言模型在 RLVR 后训练过程中思维链出现的语言漂移现象。完整解读
分析与理论arXiv:2609.25366 · 9月22日研究:思维链对答案的约束随模型相对任务难度而变化用续写扰动衡量思维链对答案的因果约束如何随任务难度变化模型与 API·测试Llama-3.1-8B-Instruct、Gemma-2-9B-IT、DeepSeek-R1-Distill-Qwen-7B 等 4 个·模型层推理链摘要在所测续写干预与模型中,思维链对答案的约束随任务和后训练条件而变。完整解读