分析与理论arXiv 2609.30768
研究:推理 token 能纠正部分偏见
用 CDPG 与 BTM 追踪思考如何改变反事实公平翻转
- arXiv
- 2609.30768
- 发表
- 层
- 模型层
- 场景
- 模型与 API
- 测试
- QwQ-32B、DeepSeek-R1-Distill-Qwen-32B、Qwen3-32B 等 5 个
用 CDPG 与 BTM 追踪思考如何改变反事实公平翻转
用续写扰动衡量思维链对答案的因果约束如何随任务难度变化
摘要在所测续写干预与模型中,思维链对答案的约束随任务和后训练条件而变。
提出 ARIA,在冻结权重上用 SAE 做推理时遗忘门控
提出 FUSE 框架,评测大语言模型的化生危险能力