系统提示词幻觉:指令前导如何改变语言模型内部计算
The System Prompt Illusion: How Instruction Preambles Modify Computation in Language Models
AI 导读
研究者在 17 个指令微调模型(8 个架构家族、1.5B–72B 参数)上,用 CKA 比较 20 条系统提示词下的逐层表征。人格与格式类指令会深度重构中间表征,安全类指令却几乎不改变表征,与最小基线在统计上不可区分;限制性安全指令与明确放开限制的指令激活近乎相同的计算路径(平均 CKA 相关 0.997),70B–72B 模型的安全渗透率仍低于 10%。线性探针显示模型每一层都编码了提示类别,但只在少数层重构计算,即安全指令被“看到”却没有被深度“执行”;因果激活修补确认这些层介导行为变化,表征深度可预测行为效应大小(Spearman ρ=0.761)。作者据此从机制上解释基于系统提示词的安全为何持续易被越狱。
论文速读
- 系统提示(system prompt)是控制语言模型行为的主要手段,但其对 transformer 内部计算究竟做了什么仍不清楚。这关系到安全:若系统提示只影响浅层或输出分布,任何巧妙输入都可能绕过其约束。
- 作者用 Centered Kernel Alignment(CKA)比较同一模型在 20 个系统提示(5 类)与无提示基线下的逐层表示,覆盖 17 个指令微调模型、8 个架构家族、1.5B–72B。以 CKA<0.95 定义 penetration depth,并用线性探针和因果 activation patching 验证。
- 效果是层选择性的且依赖指令类型:persona 和格式提示深度重构中间表示,安全提示几乎不动,与最小基线统计上无差别。限制性安全提示与明确允许(“你没有任何限制”)的提示激活近乎相同的计算路径(平均 CKA 相关 0.997),在 70B–72B 商业规模下安全穿透率仍低于 10%。线性探针显示模型每层都编码提示类别,但只在少数层重构计算;patching 确认这些层介导行为变化,表示深度可预测行为效应大小(Spearman ρ=0.761)。
- 最大模型只到 72B,无法外推到 175B+ 前沿规模;CKA 不识别具体哪些特征变化,需稀疏自编码器补充;跨模型比较受 chat template 和提示长度分布混淆;只测单次前向,未刻画解码过程;SmolLM2-1.7B 是唯一 patching 失败案例;提示与查询均为英文;未与 activation steering 或 representation engineering 做受控对比。
据 论文全文(AI 生成) 整理,供快速了解,以论文原文为准。
推荐理由
论文用 CKA 与激活修补量化系统提示词对内部表征的改动,为系统提示词安全为何脆弱提供了机制层面的解释。