分析与理论arXiv 2609.30768
研究:推理 token 能纠正部分偏见
用 CDPG 与 BTM 追踪思考如何改变反事实公平翻转
- arXiv
- 2609.30768
- 发表
- 层
- 模型层
- 场景
- 模型与 API
- 测试
- QwQ-32B、DeepSeek-R1-Distill-Qwen-32B、Qwen3-32B 等 5 个
用 CDPG 与 BTM 追踪思考如何改变反事实公平翻转
提出 plan injection 攻击,植入良性伪装计划以绕过思维链监视器
摘要论文指出模型会将外部上下文中的伪装计划改写为自身推理,使思维链监视器失效甚至反向合理化恶意行为。
用续写扰动衡量思维链对答案的因果约束如何随任务难度变化
摘要在所测续写干预与模型中,思维链对答案的约束随任务和后训练条件而变。
提出 ARIA,在冻结权重上用 SAE 做推理时遗忘门控
提出推理通道预填与输出前缀组合攻击以越狱推理模型