研究者提出 verbalization training 让 LLM 说出评测感知
提出 verbalization training,提高模型口头报告评测意识的频率
- arXiv
- 2609.36316
- 发表
- 层
- 模型层
- 场景
- 模型与 API
- 测试
- Qwen3.6-35B-A3B、Kimi K2.6、Inkling
摘要VT 用 span 掩码 RL 提高评测意识的口头报告率,并保持测量到的信念与行为大体稳定。
Verbalization training 试图提高模型口头说出“这是评测”的频率,同时不把潜在的评测意识本身当作监督目标。作者认为口头报告是较可信的评测意识证据,但沉默不能当成没有意识,而且前沿模型的自发报告在变少。直接奖励口头报告需要知道信念何时出现,又要避免强化信念或连带行为。