分析与理论arXiv:2610.02586 · 10月1日研究发现类型化决策模型主要按选项标签而非定义作答揭示类型化决策模型按选项标签而非定义规则作答模型与 API·测试von、Qwen2.5-0.5B、Qwen2.5-1.5B 等 6 个·提示层护栏与评审摘要揭示类型化决策模型被标签误导的机理,证实源于提示词渲染并给出实操建议。完整解读
分析与理论arXiv:2610.06851 · 10月5日研究发现基础模型仅靠固定开头 token 即可达到 RL 级推理表现证明短开头词可唤醒基模型推理,且效应来自训练数据模型与 API·测试Olmo-3-7B、Olmo-3-32B、Qwen3-4B 等 10 个·训练与数据层推理链完整解读
分析与理论arXiv:2609.30802 · 9月25日研究:知识蒸馏中 chat 模板会削弱学生模型的安全对齐分析良性知识蒸馏中提示模板对学生拒答保留的影响模型与 API·测试LLaMA-3.1-8B-Instruct、LLaMA-3.2-3B-Instruct、Gemma-2-9B-IT 等 7 个·训练与数据层拒答失当完整解读
分析与理论arXiv:2609.05241 · 9月4日10a Labs 测绘无审查开源模型生态:3,471 个原始模型与 8,164 次再分发测绘去安全开源模型的生产、重分发与下游应用留存机制模型与 API·测试Qwen、Llama、Gemma 等 10 个·训练与数据层模型篡改微调与开源权重摘要论文测绘了去安全开源大模型供应链,作者指出高集中度的重分发层赋能模型持久留存与部署扩散。完整解读