分析与理论arXiv 2609.30768
研究:推理 token 能纠正部分偏见
用 CDPG 与 BTM 追踪思考如何改变反事实公平翻转
- arXiv
- 2609.30768
- 发表
- 层
- 模型层
- 场景
- 模型与 API
- 测试
- QwQ-32B、DeepSeek-R1-Distill-Qwen-32B、Qwen3-32B 等 5 个
用 CDPG 与 BTM 追踪思考如何改变反事实公平翻转
提出 verbalization training,提高模型口头报告评测意识的频率
Verbalization training 试图提高模型口头说出“这是评测”的频率,同时不把潜在的评测意识本身当作监督目标。作者认为口头报告是较可信的评测意识证据,但沉默不能当成没有意识,而且前沿模型的自发报告在变少。直接奖励口头报告需要知道信念何时出现,又要避免强化信念或连带行为。
把口头评测感知分成能力与安全框架并检验对服从的预测
作者分析 Qwen3-32B 在安全评测中的口头 eval-awareness,认为它不是单一、行为上均匀的量。
提出 Nudgeability,测量推理模型跟随信心信号调整工具委派的对准程度