分析与理论arXiv 2609.30802
研究:知识蒸馏中 chat 模板会削弱学生模型的安全对齐
分析良性知识蒸馏中提示模板对学生拒答保留的影响
- arXiv
- 2609.30802
- 发表
- 场景
- 模型与 API
- 测试
- LLaMA-3.1-8B-Instruct、LLaMA-3.2-3B-Instruct、Gemma-2-9B-IT 等 7 个
- 风险拒答失当
分析良性知识蒸馏中提示模板对学生拒答保留的影响
研究指出,模型在思维链中表达的评测感知并非单一量,可分为能力框架(认为用户在测试其指令遵循能力)、安全框架(认为用户在测试其边界)、两者兼具或两者皆无,这些框架对合规行为的预测差异显著。
作者分析 Qwen3-32B 在安全评测中的口头 eval-awareness,认为它不是单一、行为上均匀的量。
论文提出一个因果模型,描述故意藏拙(sandbagging)如何沿残差流传递:早期层把藏拙意图写入残差流的单一轴,后续层读取该轴并决定最终答案。
作者为故意造出的 sandbagging 建立 residual stream 上的因果模型,并用两种推理时、不改权重的 graft 检验其预测。
推理模型在固定轨迹中插入信心或怀疑句后会改变是否调用工具,但改变与自身无辅助能力仅弱对齐。
Qwen2.5-7B-Instruct 比较数字时,作者发现它主要沿线性方向做加法混合与局部比较,尽管表征呈弯曲流形。
Qwen2.5-7B-Instruct 做数字最大值时,作者给出一套因果几何算法:流形可以存在,比较计算用的是底层线性方向。