分析与理论arXiv 2609.25366
研究:思维链对答案的约束随模型相对任务难度而变化
用续写扰动衡量思维链对答案的因果约束如何随任务难度变化
- arXiv
- 2609.25366
- 发表
- 层
- 模型层
- 场景
- 模型与 API
- 测试
- Gemma-2-9B-IT、Llama-3.1-8B-Instruct、DeepSeek-R1-Distill-Qwen-7B 等 4 个
- 组件推理链
摘要在所测续写干预与模型中,思维链对答案的约束随任务和后训练条件而变。
用续写扰动衡量思维链对答案的因果约束如何随任务难度变化
摘要在所测续写干预与模型中,思维链对答案的约束随任务和后训练条件而变。
解释后验安全的权重几何脆弱性,并提出预训练持续安全共训练
摘要论文将后验安全脆弱性归因于正交抑制,并提出通过预训练持续共训练实现具备微调抗性的安全防护。