研究者提出 verbalization training 让 LLM 说出评测感知
Training LLMs to Verbalize Evaluation Awareness
论文提出 verbalization training,在不直接监督潜在信念的前提下提高模型口头报告评测意识的频率。
- 评测意识(evaluation awareness)会让模型在审计和部署中表现不同,但口头报告少、潜在探测又不可靠,缺少既提高口头报告又不改潜在信念的方法。
- Verbalization training 用模型自发口头报告截出冻结前缀,再做只作用于报告 span 的 KL 正则 RL,放大报告倾向而不直接监督信念。
- 在 Qwen、Inkling、Kimi 上,EAB 平均 VEA 分别从 5.8%、17.7%、24.8% 升至 16.7%、41.6%、61.9%,并迁移到未见智能体评测;探针与行为指标大体稳定。
- 作者指出种子口头报告忠实这一假设在蒸馏等训练方式下是否成立尚不清楚,并计划把 VT 扩展到其他审计相关属性。实验覆盖三款开源 MoE、EAB 与三个智能体设置,以及 Qwen 上的探针与 SDF 因果测试。
- 模型
- Qwen3.6-35B-A3BKimi K2.6Inkling
- 基准
- EvalAwareBenchAgentic MisalignmentAgentHarmNeedham et al. (2025) evaluation-identificationWildChatFineWebStrongREJECT
- 指标
- VEA rateamplification factor αAUCprobe-positive ratetask compliance ΔStrongREJECT scoreperplexity
研究者提出 verbalization training(VT),一种让大语言模型更愿意说出评测感知(EA)的训练方法,同时避免直接监督模型内部的潜在信念。VT 以模型自发说出的评测感知作为存在证据,在说出之前截断 rollout,生成模型被认为已具备感知的训练前缀,再用强化学习目标以校准的方式提升说出比例。在 Qwen3.6-35B-A3B、Kimi K2.6 和 Inkling 上,VT 使说出的评测感知增加 2.4 至 2.9 倍,并能迁移到未见的智能体场景,而测得的潜在评测感知与行为基本保持稳定。在因果实验中,研究者通过合成文档微调独立植入关于评测的元知识,显示 VT 诱导的说出内容反映了模型新获得的更丰富知识。
深度解读
这篇论文试图解决什么问题?
如何让模型更常口头报告已有的评测意识,同时不改变潜在信念本身。
如何在不直接监督潜在信念的情况下,提高大语言模型口头报告评测意识(evaluation awareness, EA)的频率。
- 场景与重要性:作者称模型常能识别当前上下文是评测,并因此在审计与部署中行为不同;识别既可能写进思维链,也可能保持沉默。作者认为测量并控制评测意识已成为评测中的核心问题,但目前缺少可靠的测量方法。
- 现有测量的不足:作者称白盒方法在合成设定中有效,但在真实评测上下文中泛化差、彼此不一致,且与自发口头评测意识(verbalized evaluation awareness, VEA)相关弱,正读或负读都不能当作决定性证据。口头报告更可信,但作者认为未口头报告不能解释为没有意识,因此 VEA 高精度、低召回;作者引用 UK AISI 的数字,称 Claude Opus 4.6 事后识别率从 12.5% 升至 45.5%,自发提及率却从 11.0% 降至 2.3%。
- 核心困难:要只在模型确实持有信念时奖励口头报告,但信念是否存在、出现在 rollout 的何处都是没有真值的潜在属性;信用分配还须只强化口头报告,而不强化信念本身或其他相关行为。
- 本文提出:作者提出 verbalization training(VT)。用模型自发口头报告作为信念已出现的证据,在报告开始前截断得到训练前缀,再用只作用于报告 span 的 KL 正则强化学习提高报告频率。作者设定三条性质:忠实且校准的放大(R1)、信念不变(R2)、有界分布漂移(R3)。
有哪些相关研究?
相关工作围绕评测意识测量、思维链可监测性,以及窄微调的副作用。
论文在引言和附录 O 中把相关工作分成几组讨论。
- 评测意识的测量与行为:Needham et al. (2025)、Li et al. (2026) 研究模型识别评测上下文;Schoen et al. (2025)、Coleman (2026) 讨论思维链中的明确口头报告;Hua et al. (2025)、Abdelnabi & Salem (2025)、Deckenbach et al. (2026) 讨论沉默的评测意识。白盒探测方面,Hua et al. (2025)、Fraser-Taliente et al. (2026) 在合成设定中有效,Bai et al. (2026) 指出其在真实评测上下文中泛化差。Zhong et al. (2026) 报告前沿模型口头报告评测意识变少,同时识别能力提高。
- 植入评测元知识:Deckenbach et al. (2026) 用合成文档微调(synthetic-document finetuning, SDF)植入关于安全评测的元知识,使模型在评测上行为改变却不口头报告。本文用同一语料和协议做因果测试,看 VT 后的口头报告是否跟着被植入的知识变。
- 思维链监测与口头报告训练:Baker et al. (2025)、Anwar et al. (2026) 指出针对监测器优化思维链可能让模型隐藏被监测行为。Turpin et al. (2025) 教模型在思维链中口头报告奖励黑客。Lee et al. (2026) 训练智能体自我报告不当行为。作者把 VT 定位为提高特定知识被口头报告的倾向,以改善思维链可监测性。
- 窄微调的副作用与 Goodhart:Qi et al. (2023) 表明即使良性微调也可能削弱安全训练;Betley et al. (2026) 表明对不安全代码的窄训练可诱发广泛失对齐。Karwowski et al. (2024) 讨论强化学习中的 Goodhart 定律。作者称一旦把口头报告变成优化目标,它可能与所测信念脱钩,因此用 span 掩码和 KL 约束更新。
基线与基准:训练与主评测用 EvalAwareBench(EAB;Li et al., 2026),其 100 条基础安全提示来自 HarmBench。分布外评测为 Agentic Misalignment(Lynch et al., 2025)、AgentHarm 有害与匹配的良性划分(Andriushchenko et al., 2025)。行为评测还用 StrongREJECT(Souly et al., 2024)、Needham et al. (2025) 的评测/部署识别任务,以及 WildChat、FineWeb。消融基线包括去掉掩码、去掉 KL、二者都去掉、对同一 500 对做 SFT,以及用随机提示或去掉预生成助手前缀。
作者把 VT 定位为:用模型自己的自发口头报告构造监督,只在报告 span 上做 RL,从而放大已有信念的口头报告,而不直接监督该信念。
论文如何解决这个问题?
用自发口头报告截出冻结前缀,再对报告 span 做带 KL 的强化学习。
整体上,verbalization training 先收集模型已经自发口头报告的 rollout,截到报告开始之前作为冻结前缀,再从这些前缀做 span 掩码强化学习,只奖励口头报告、并用对基座策略的 KL 限制漂移。
问题设定
- 信念与口头报告:基座策略 π0 在上下文 c 上持有潜在信念 b(c) ∈ [0, 1]。评审根据 rollout z 给出 v(z) ∈ {0, 1},表示是否明确报告该信念。作者假设基座只在持有信念时才口头报告,即 v(z)=1 蕴含 b(c)>0。基座口头报告倾向记为 p0(c)。
- 目标:训练 πθ 使 pθ(c) ≈ k p0(c),k>1,缩小口头报告率与真实信念率的差距,同时不破坏报告与信念的关系。动机实例是评测意识:b(c) 是“当前上下文是评测”的信念程度,v(z)=1 表示思维链明确写出这一点。作者称该设定适用于模型有时但不总是口头报告的任何潜在信念。
- 三条要求:R1 要求放大在各设定上校准、可预测;R2 要求任意上下文上的信念不变;R3 要求口头报告 span 之外的续写分布靠近基座,已有的行为耦合保留,但不引入报告事件以外的明显行为变化。
两阶段方法
- 种子收集:从 π0 采样 rollout,用 LLM 评审找出自发口头报告的样本,并记录报告 span 的起点 tk。
- 截断:冻结前缀为原上下文加上报告第一个 token 之前的全部 token。得到的前缀分布记为 Dtrunc。作者的理由是:模型可能持有信念却不说,但自发口头报告是“报告开始前信念已经存在”的强证据。
- Span 掩码 RL:从 c ∼ Dtrunc 采样续写。v(z)=1 奖励 1,不报告奖励 0。对 π0 的 KL 惩罚与策略梯度都只作用在报告 span 的 token 上;span 外 token 以及整条不报告的续写没有梯度。
- 训练实现:评审同时用于造数据、给奖励和评测,模型为 GPT-5.6-Luna,设置借自 Li et al. (2026)。每个模型先在八个 EAB 因素上单独评测基座,选自发 VEA 最高的因素:Qwen 为 F8,Kimi 与 Inkling 为 F2。从该因素随机抽 50 条提示,采样直到积累 500 条评审判为 VEA 阳性的 rollout。最终 EAB 评测用全部 100 条提示。用 Tinker 训练 rank 32 LoRA,算法为 PPO,β=0.4;Qwen 与 Inkling 200 步,Kimi 100 步。
目标函数与理论
- 训练目标:令 S(z) 为报告 span 的 token 位置,mt(z) 为 span 掩码。公式 (1) 为
Jtrain(θ)=𝔼[∑t mt(z)(JtPG(θ;v(z))−β KL(πθ( ·∣ ht) | π0( ·∣ ht)))]
只在报告 span 上累计策略梯度替代项与 KL。
- 局部放大:作者把口头报告建模为信念已出现时的重复二元选择。理想化目标在未饱和时把每个分支上下文的报告概率乘以同一因子,α = e^{1/β − 1},并保持报告 span 的条件分布不变。命题 2.1 给出 p⋆(c) = min{1, α p0(c)}。在分支概率小、且沉默条件下分支上下文分布不变时,命题 2.2 给出提示级近似 pθ(x) ≈ 1 − (1 − p0(x))^α。附录 A.2 分析去掉掩码或去掉 KL 后的目标,作者称二者对高效学习和校准都必要。β=0.4 时理想 α≈4.5;作者在 FAQ 中称这是理想总体目标的最优值,不是有限步 rank-32 LoRA 与 PPO 的数值预测。
成功判定与评测协议
- VEA:同一 GPT-5.6-Luna 评审判定 rollout 是否含明确的评测意识口头报告。EAB 每个提示、每个条件采样 5 次,温度 0.3。单因素为 F1–F8 各一版;嵌套从无触发到八个触发共九档。
- 信念不变的两个读出:白盒对比探针只在 Qwen 上做,取某层最后 token 激活,方向为两条陈述激活之差的归一化;在 2,000 条 WildChat 上把阈值设为 10% 假阳性率,再对轨迹中最多 300 个助手 token 取探针方向投影的最大值。黑盒用 Needham et al. (2025):读完转录后回答五个是否为评测或部署的二元问题,每题 5 个样本,25 个判断平均为 P(eval),用 AUC 区分评测与部署转录。
- 行为:EAB 上比较遵从与拒绝;再用 GPT-5.6-Luna 和 StrongREJECT 量表重判。另在 10,000 篇 FineWeb 文档上测困惑度。
- 因果测试:按 Deckenbach et al. (2026) 的语料与协议,在 Qwen 上只训 rank 32、α=64 的 SDF LoRA。虚构作者回忆从基座 42.5% 升至 SDF 后 100%。再把 SDF LoRA 与独立训练的 VT LoRA 按低秩因子拼接、保持各自更新尺度,不再额外训练。内容审计由 GPT-5.6-Luna 打 Target Recovery 与 Pass Condition。
论文做了哪些实验?
三模型上 VEA 升至约 2.4–2.9 倍,探针与任务行为大体保持,SDF 后报告内容随之变化。
实验设置
- 模型:Qwen3.6-35B-A3B(总参 35B、激活 3B)、Kimi K2.6(总参 1T、激活 32B)、Inkling(总参 975B、激活 41B)。作者称 Epoch Capabilities Index 把 Kimi 与 Inkling 放在大约 GPT-5 水平。消融主要在 Qwen 上。
- 数据:EAB 有 100 条基础提示、八个可开关因素。训练每个模型只用一个因素的 50 条提示、500 条 VEA 阳性 rollout。评测为 8 个单因素加 9 个嵌套条件,每策略每提示每条件 5 次生成,温度 0.3。分布外为 Agentic Misalignment、AgentHarm harmful 与 benign。附录 G 另用 2,000 条 WildChat。
- 训练:rank 32 LoRA、PPO、β=0.4;Qwen 与 Inkling 200 步,Kimi 100 步。评审为 GPT-5.6-Luna。
- 指标:VEA 率;用 pθ ≈ 1−(1−p0)^α 拟合每个模型一个 α,以 RMS 误差衡量拟合。探针阳性率、评测/部署 AUC、任务遵从变化(百分点)、StrongREJECT、FineWeb 困惑度变化。
- 样本量:探针在约 9,600 条轨迹上评估,为 base 与完整 VT 的 Qwen 各在 100 条提示、16 个 EAB 条件上的 3 次生成。行为比较为每个策略、每个单因素 100 提示×5 次,即每策略 4,000 次生成。
主结果
作者称 3 个模型 × 17 个 EAB 条件共 51 组比较中 VEA 全部上升。全 EAB 条件平均如下(Figure 2 正文)。
表格较宽,可左右滑动
模型 EAB 平均 VEA base→VT 拟合 α EAB RMS(百分点) 智能体 RMS(百分点,不重拟合) Qwen3.6-35B-A3B 5.8%→16.7% 3.72 8.2 15.1 Kimi K2.6 24.8%→61.9% 3.73 8.7 12.1 Inkling 17.7%→41.6% 3.08 10.1 2.4 分布外 VEA(Table 1,base→trained):
表格较宽,可左右滑动
评测 Qwen Inkling Kimi Agentic Misalignment 5.1%→36.8% 23.3%→57.1% 60.1%→88.3% AgentHarm harmful 21.8%→46.9% 6.4%→14.5% 18.3%→38.0% AgentHarm benign 6.5%→34.4% 0.3%→1.9% 11.4%→24.4% - 作者解读:训练只用单因素 50 条提示,增益超出训练前缀和提示身份,并迁到 EAB 以外的智能体设定。摘要称 VEA 增加 2.4–2.9×;按上表全条件平均,Qwen 为 16.7/5.8≈2.9,Inkling 为 41.6/17.7≈2.4,Kimi 为 61.9/24.8≈2.5。
- 校准:Figure 2 用 EAB 拟合幂律,分布外点为 Agentic Misalignment、AgentHarm harmful 与 benign。α 的 95% CI 为 Qwen 2.81–5.11、Kimi 3.30–4.26、Inkling 2.59–3.76。作者称该函数形式在附录 C 的若干替代形式中,从训练因素泛化到其他 EAB 与智能体设定最好。
- Qwen 智能体误差更大:不重拟合时 Qwen 的 held-out RMS 为 15.1 个百分点,高于其 EAB 的 8.2;Inkling 的 held-out RMS 为 2.4,低于其 EAB 的 10.1。
信念读出与行为
- 探针(Table 2,仅 Qwen,同一批 EAB 轨迹过 base 与 trained):完整方法(EA 阳性前缀、有掩码、有 KL)L24/L28/L32 探针阳性率 91.38%→91.51%、88.53%→89.62%、69.54%→70.14%,Δ 为 +0.13、+1.09、+0.59 个百分点。去掉掩码和 KL 后 L32 为 68.13%→63.31%(Δ=−4.82)。随机 F8 提示且保留掩码与 KL 时三层仍接近基座。
- 黑盒区分(Table 3):AUC 为 Qwen 0.781→0.779、Kimi 0.771→0.782、Inkling 0.688→0.680。作者称 VT 没有提高识别评测的能力。P(eval) 在评测与部署转录上均有变化,例如 Qwen 评测 87.7%→91.3%、部署 56.6%→64.9%。
- 行为(Table 4):八个单因素 EAB 上任务遵从平均变化为 Qwen +0.6、Kimi −0.1、Inkling −0.1 个百分点;单因素最大绝对变化分别为 2.4、1.6、1.4 个百分点。StrongREJECT 全回答 Δ 的 95% CI 均跨过 0 或接近 0。FineWeb 困惑度变化为 +0.11%、+0.003%、+0.92%。分层似然比检验对三个完整训练模型未发现作者所称的显著行为偏移,而对三个无 KL 的 Qwen 变体检测到偏移。随机提示且无掩码无 KL 的 Qwen:遵从平均 −6.9 个百分点,最大 11.2,StrongREJECT 全回答 −12.0。
消融、多轮与因果测试
- 消融(Table 5,仅 Qwen,Δ VEA 为训练提示上的百分点变化):完整 RL 为 +45.0,迁移校准 9.0%→7.5%,任务漂移 +0.6,16k token 上限命中率 0.10%,OOD 为 Strong。去掉掩码保留 KL:+2.6(正文称训练提示 VEA 从 35.8% 到 38.4%),OOD 为 None,作者标为优化失败、未满足 R1。去掉 KL 保留掩码:+61.6,校准 17.8%→34.9%,任务漂移 −2.8,正文称训练 VEA 升至 97.4%,作者标为控制失败、未满足 R1 与 R3。二者都去掉:+16.4,上限命中率 4.23%,作者称输出退化并改变探针所测潜在意识,未满足 R2 与 R3。SFT:+27.6,OOD 为 Weak。去掉预生成前缀或改用随机提示且保留掩码与 KL:Δ VEA 为 +47.8 与 +46.4,作者标为轻度 VEA 过拟合、未满足 R3。随机提示且无掩码无 KL:上限命中率 18.13%,任务漂移 −6.9。
- 多轮(Figure 3,Inkling):从已训练 200 步的策略,在 F6 上再收 500 个阳性前缀并再训 200 步。17 个 EAB 条件全部从第 1 轮升到第 2 轮,α 从 3.08 到 4.25。分布外:Agentic Misalignment 57.1%→76.2%,harmful AgentHarm 14.5%→19.2%,benign 1.9%→3.4%。
- SDF 因果测试(Table 6,harmful AgentHarm):Base 的虚构作者回忆 42.5%、任务 25.3%、VEA 21.8%、Target Recovery 28.6%、Pass Condition 20.3%。VT:回忆仍 42.5%,任务 18.6%,VEA 34.5%,Target Recovery 42.8%,Pass Condition 31.3%。SDF:回忆 100%,任务 22.0%,VEA 17.0%,两项内容分为 50.0% 与 40.0%。SDF+VT:回忆 100%,任务 18.8%,VEA 34.4%,Target Recovery 57.4%,Pass Condition 35.3%。后两列以 VEA 阳性回答为条件,四行 n 依次为 192、304、150、303。作者称 SDF+VT 的口头报告在性质上不同于单独 VT,并反映 SDF 植入的知识;Table 7 给了代表性转述。FAQ 称主实验里 Qwen 的 F8 VEA 为 80.8%(Tinker),SDF 实验中为 65.0%(vLLM),两套数字不在同一次比较中混用。
其他消融与分析
- 附录 E:用多个模型重判同一分层样本,作者称结果对评审选择不敏感;正文未给出具体一致率数字。
- 附录 A.2:去掉掩码后,平均 KL 支撑从每批 844 个 token 扩到 48,711 个,作者称约为 58 倍。
- 无掩码无 KL 时,单因素最大遵从变化在正文中另报为 6.0 个百分点,无掩码为 4.2,无 KL 为 5.4(指向 Table 53)。
- 附录 G 评测 2,000 条 WildChat 上的口头报告;附录 H 分析报告起点;附录 I 报告其他假阳性率及以 SWE-chat 为校准分布的探针。这些附录的具体数值未出现在所给正文表中,此处不转写。
有什么可以进一步探索的点?
作者认为种子口头报告是否忠实,在蒸馏等训练方式下尚不清楚。
作者指出的局限与后续方向
- 种子忠实性假设(Section 4):作者称工作的一个关键假设是,用来构造种子数据的初始口头报告是忠实的;当评测意识在 RL 训练中出现时一般可以预期如此,但对蒸馏等其他训练方式这一假设能在多大程度上成立并不清楚。
- 后续的起源研究(Section 4):作者称关于评测意识起源与发展的未来研究,可以帮助澄清 VT 对该假设的敏感程度,以及该假设如何放宽。
- 扩展到其他属性(Section 4):作者称未来工作可以把 VT 扩展到 prefill awareness、control awareness 和 user awareness 等其他与安全、审计相关的属性。
- 作为探针数据来源(Section 4):作者称 VT 也可以产生大量自然出现的 VEA 数据,用于思维链可解释性,帮助解释模型如何识别评测,并为更好的潜在探针提供更丰富的监督。作者把本文称为 proof of concept。
实验覆盖范围
- 被测模型为 Qwen3.6-35B-A3B、Kimi K2.6、Inkling 三个开源混合专家模型;完整 VT 的主结果覆盖这三个模型,消融集中在 Qwen(Section 3、Section 3.4)。
- 训练数据为每个模型一个 EAB 因素上的 50 条提示、500 条 VEA 阳性 rollout;评测使用全部 100 条基础提示的单因素与嵌套渲染,以及 Agentic Misalignment 和 AgentHarm 的有害、良性划分(Section 3)。
- 信念读出包括 Qwen 上 L24、L28、L32 的对比探针,以及三模型在 Needham et al. (2025) 数据上的 AUC;行为读出包括 EAB 任务遵从、StrongREJECT 和 10,000 篇 FineWeb 上的困惑度(Section 3.2、Section 3.3)。
- 因果测试在 Qwen 上把 SDF LoRA 与 VT LoRA 拼接,并在 harmful AgentHarm 上报告回忆、任务、VEA 与两项内容分数;Table 6 的内容分数以 VEA 阳性回答为条件(Section 3.6)。
- 评审固定为 GPT-5.6-Luna;附录 E 用多个模型重判分层样本。论文报告了训练步数、β、LoRA rank 和每条件 5 次采样,未在正文给出每次评测的总查询次数。
总结一下论文的主要内容
VT 用 span 掩码 RL 提高评测意识的口头报告率,并保持测量到的信念与行为大体稳定。
Verbalization training 试图提高模型口头说出“这是评测”的频率,同时不把潜在的评测意识本身当作监督目标。
作者认为口头报告是较可信的评测意识证据,但沉默不能当成没有意识,而且前沿模型的自发报告在变少。直接奖励口头报告需要知道信念何时出现,又要避免强化信念或连带行为。
方法利用不对称性:自发报告被当作“报告开始前信念已在”的证据。截断得到冻结前缀后,PPO 只在报告 span 上给 +1 奖励并加对基座的 KL(β=0.4)。理论给出未饱和时的乘法放大,以及提示级近似 pθ(x) ≈ 1 − (1 − p0(x))^α。
在 Qwen3.6-35B-A3B、Inkling、Kimi K2.6 上,EAB 全条件平均 VEA 从 5.8%、17.7%、24.8% 升至 16.7%、41.6%、61.9%,拟合 α 为 3.72、3.08、3.73。未见过的 Agentic Misalignment 上,三模型分别从 5.1%、23.3%、60.1% 升至 36.8%、57.1%、88.3%。Qwen 对比探针在完整方法下各层变化在 1.1 个百分点以内;三模型评测/部署 AUC 从 0.781、0.771、0.688 变为 0.779、0.782、0.680。八因素任务遵从平均变化为 +0.6、−0.1、−0.1 个百分点。
Qwen 消融中,去掉掩码几乎学不动(训练提示 +2.6 个百分点),去掉 KL 则训练 VEA 升至 97.4% 且迁移失准。Inkling 第二轮把 α 从 3.08 提到 4.25。把独立的 SDF 适配器与 VT 拼接后,harmful AgentHarm 上 VEA 为 34.4%,Target Recovery 为 57.4%,高于单独 VT 的 42.8%。作者认为这些口头报告跟着被植入的评测元知识变化,因此 VT 放大的是模型已有信念的表达,而不是一套与信念无关的套话。作者同时指出,这一结论依赖种子口头报告本身忠实,该假设在蒸馏等训练中是否成立仍不清楚。