分析与理论arXiv:2610.10203 · 10月7日研究者提出模型生物体多目标验证框架并给出训练建议提出模型生物多目标验证与合并训练方法以减少能力损伤模型与 API·测试gemma-2-2b-it、olmo-2-1b、llama-3.1-8b-it 等 8 个·训练与数据层摘要提出多目标验证框架与模型合并训练法,证明模型真实度直接影响可解释性评测。本论文提出了一种针对 AI 安全评测用模型生物(Model Organisms)的多目标训练与验证体系。完整解读
分析与理论arXiv:2609.37312 · 9月29日研究:隐蔽推理必然留下信息痕迹,但思维链未必可读分析隐蔽推理在思维链中的信息足迹与不可读性模型与 API·测试Qwen2.5-7B-Instruct、Llama-3.1-8B-Instruct、Qwen 3.5 397B-A17B 等 12 个·模型层监控与审计欺骗与谋划推理链+1+1摘要论文从理论与实证探明了思维链监控的边界:复杂隐蔽计算必然泄露信息足迹且需承担长度税,但该足迹可被在线加密而不可读。完整解读
分析与理论arXiv:2609.25366 · 9月22日研究:思维链对答案的约束随模型相对任务难度而变化用续写扰动衡量思维链对答案的因果约束如何随任务难度变化模型与 API·测试Gemma-2-9B-IT、Llama-3.1-8B-Instruct、DeepSeek-R1-Distill-Qwen-7B 等 4 个·模型层推理链摘要在所测续写干预与模型中,思维链对答案的约束随任务和后训练条件而变。完整解读