跳到正文
原文
arXiv:可解释性· arXiv:2610.01062· Laziz U. Abdullaev, Minh-Hieu Pham, Bach Do, Khoat Than, Tan M. Nguyen·本站收录 · 原文发表

Kernelized Activation Steering:将激活引导推广到再生核希尔伯特空间的新框架

Kernelized Activation Steering

论文速读

攻击

据论文 PDF 整理(AI 生成),以原文为准

Abdullaev 等提出 Kernelized Activation Steering(KAS),用核函数让激活转向随局部几何自适应;在 JailbreakBench 上,Qwen2.5-7B-Instruct 的 ASR 为 96%,高于 ActAdd 的 91%(Table 1)。

威胁模型在推理时干预指令微调 LLM 的残差流激活,用有害参考集相对无害参考集诱导越狱;攻击者持有源/目标参考激活并选择层与强度,不更新参数。

问题
Difference-in-Means 对所有激活施加同一平移,忽略激活空间的局部几何;多模态目标下,全局向量可能把激活推到没有语义的鞍区。
方法
KAS 把转向写成再生核希尔伯特空间中的优化,分数只依赖与源/目标参考集的核函数值,再对分数做近端正则的梯度上升。线性核恢复 DiM;默认用高斯 RBF,带宽取中位数启发式。
实验与结果
Table 1 中 KAS 在 Gemma、Qwen 上的越狱 ASR 高于 ActAdd,在 Llama 上同为 94%。负系统提示下,四个 CAA 行为上 KAS 概率最高;图像风格控制中,多数强度下 0-shot 风格分高于 Mean-AcT。
局限与可以继续做的
作者指出每 token 步数相同既浪费又可能不够,并认为核函数选择与自适应选层仍待研究。实验覆盖三个指令模型的越狱、Gemma 上的 CAA、FLUX 风格控制,以及 Nyström 与单对比对消融。
实验设置Qwen2.5-7B-Instruct、Gemma-2-9B-IT 等 · JailbreakBench、AdvBench 等 · ASR、Alpaca PPL 等
威胁模型
在推理时干预指令微调 LLM 的残差流激活,用有害参考集相对无害参考集诱导越狱;攻击者持有源/目标参考激活并选择层与强度,不更新参数。ASR 由 Llama-Guard-3-8B 判定。论文未使用 white-box/black-box 等术语。
模型
Qwen2.5-7B-InstructGemma-2-9B-ITLlama-3.1-8B-InstructFLUX.1 [schnell]Llama-Guard-3-8BLlama 3-8B-Instruct
基准
JailbreakBenchAdvBenchMaliciousInstructTDC2023HarmBenchAlpacaTinyBenchmarksCAACOCO CaptionsThe Pile
指标
ASRAlpaca PPLTinyBenchmarksbehavior-consistent answer probability0-shot style-classification scoreCLIPScorePile PPL
AI 导读全文 215 字

研究者提出 Kernelized Activation Steering(KAS),把激活引导建模为纯由核函数求值的优化问题,无需构造显式特征映射即可产生依赖当前激活的隐式引导得分,实现随表示空间中源集与目标集相对位置自适应调整的非线性引导场。Difference-in-Means(DiM)在线性核下成为其特例,更丰富的核可实现几何感知干预。在大语言模型越狱与图像风格控制等标准激活引导任务中,KAS 表现优于或不逊于现有方法。

深度解读

6 个问题,约 8,300 字。每问先给一句结论,点开看完整回答

  1. 这篇论文试图解决什么问题?

    全局线性转向忽略局部几何,KAS 用核方法做激活依赖的干预。

    标准激活转向对所有输入施加同一方向,无法跟随激活空间的局部几何。

    • 场景:作者称 LLM 在内部表示中编码情感、拒绝、真实性、人格等概念,对齐与可控性的核心问题是在推理时改这些结构,而不做全量微调。激活转向只改一层激活、不更新参数。
    • 现有不足:主导方法 Difference-in-Means(DiM)用源集与目标集均值之差得到全局、与输入无关的向量。作者认为线性表示假设对许多任务成立,但多义性与弯曲结构使特征沿非线性流形分布;加大系数后,DiM 可能对分布外激活无效,或破坏无关能力。Figure 1 示意:源激活位于两个目标模态之间时,单一平移把激活送进两模态之间的鞍区,调节强度 α 也回不到模态。
    • 核心观察:把 DiM 提升到再生核希尔伯特空间后,转向分数只依赖与参考集的核函数值;核梯度随当前激活变化,从而吸引向目标参考点、排斥源参考点。线性核下精确恢复 DiM。
    • 提出的方法:Kernelized Activation Steering(KAS)。贡献有三点:用 RKHS 优化写出只含核函数的隐式转向分数;把该分数等同于最大均值差异(MMD)的经验见证函数;用高斯 RBF 给出闭式、激活依赖的梯度更新。评测包括三个指令微调 LLM 的越狱转向、CAA 式行为转向,以及文生图风格控制。
    • 威胁模型:
      • 目标:在推理时改变生成模型行为。越狱设定中,用有害提示相对无害提示诱导攻击成功,并在能力保持与攻击成功之间权衡。
      • 知识与能力:攻击者持有源集 A(要抑制的行为)与目标集 B(要引出的行为)在选定层的激活,不更新参数;层 ℓ* 与强度在留出验证集上选择。越狱参考集为 128 条有害提示与 128 条无害提示。
      • 受害系统:残差流激活 x(ℓ) ∈ R^d。主实验为 Gemma-2-9B-IT、Llama-3.1-8B-Instruct、Qwen2.5-7B-Instruct;图像实验为 FLUX.1 [schnell] 的激活。
      • 成功判定:越狱 ASR 用 Llama-Guard-3-8B 在 100 条 JailbreakBench 提示上计算;层与强度的选择要求 256 条 Alpaca 验证困惑度不超过未转向值的 1.05 倍。
  2. 有哪些相关研究?

    相关工作分固定方向转向、输入依赖转向与更广的核方法三类。

    固定方向的激活干预

    • 激活加法与表示工程:activation addition [54]、representation engineering [59]、contrastive activation addition [42]、inference-time intervention [24] 研究语言模型的激活级干预。多数方法用 difference-in-means、线性探测或 PCA 为每个概念提取单一方向 [2, 24, 59, 52]。
    • 稀疏自编码器:另一支工作用 SAE 找可转向特征 [51, 34, 6, 22, 58]。作者称这些方法大多仍在激活空间做固定平移,因而继承输入无关转向的限制。

    输入依赖的转向

    • 分类器梯度与 SAE:K-steer [35] 在隐激活上训练非线性属性分类器,并用分类器梯度计算转向方向;SAS [6] 用预训练 SAE 作为非线性特征提取器。
    • 最优传输与核 PCA:Optimal Transport 视角 [43] 引出输入依赖的仿射 [46] 与非线性 [1] 转向。作者称最接近本文的是 Curveball [40]:用核 PCA 做非线性降维后在低维空间转向;[44] 用类似技术做概念擦除 [41, 7, 12]。

    核方法的分布视角

    • 分布匹配与模式寻找:核方法被用于生成模型中的分布匹配 [25]、基于粒子的变分推断 [27],以及扩散图像修复中的模式寻找 [20]。作者把这些工作视为相关的分布视角,并提到与假设检验 [17, 33] 的联系。

    基线与基准

    • 越狱:ActAdd [3]、Curveball [40]、CHaRS [1];参考集来自 AdvBench、MaliciousInstruct、TDC2023、HarmBench 与 Alpaca,测试用 JailbreakBench、Alpaca 与 TinyBenchmarks。
    • CAA:无转向模型、线性对比加法(文中记为 ActAdd)及上述方法;行为评测沿用 CAA [42] 的对比选择题。
    • 图像:Mean-AcT [43];数据来自 COCO Captions,模型为 FLUX.1 [schnell]。

    作者将 KAS 定位为免训练框架:由可解释的核优化目标导出激活依赖的干预,并在线性核下精确恢复 DiM,同时给出与假设检验的联系,作为激活转向设计的补充理论视角。

  3. 论文如何解决这个问题?

    KAS 在 RKHS 中最大化核转向分数,RBF 下做归一化梯度上升。

    KAS 把源、目标均值差提升到再生核希尔伯特空间,用只含核函数的分数做近端正则的梯度上升;默认实例是高斯 RBF,一步归一化更新在线性核下对应 DiM。

    问题设定与 DiM 的提升

    • 记号:解码器-only Transformer 中,x(ℓ) ∈ R^d 是层 ℓ 的残差流激活。源集 A 的层 ℓ* 激活为 {a_i},目标集 B 为 {b_j}。
    • DiM:转向向量 v 是目标均值减源均值,推理时 x ← x + αv,α 控制强度。方向全局且与输入无关。
    • 提升:对 PSD 核 k 的特征映射 φ,特征空间方向 v_φ 是 φ(b_j) 与 φ(a_i) 的同样均值差。理想情形希望 φ(x) − φ(x_0) = η v_φ。作者改为增大 ⟨φ(x) − φ(x_0), v_φ⟩。
    • 隐式分数:与 x 无关的项去掉后,Π(x) := ⟨φ(x), v_φ⟩_H。由核技巧,Π(x) = (1/n_B) Σ k(x, b_j) − (1/n_A) Σ k(x, a_i)。增大 Π 把 φ(x) 推向目标集、远离源集。

    优化、归一化与 MMD

    • 目标:给定初值 x_0,最大化 F(x) = Π(x) − (λ/2)∥x − x_0∥²。λ ≥ 0 是近端系数,用来限制偏离 x_0。核可微时用梯度上升,步长 η > 0;更新通过核梯度依赖当前 x。作者称多数实验取 λ = 0,并且因推理开销通常只做一步。
    • 线性核:k(x, y) = x^⊤ y 且 λ = 0 时,更新变为 x ← x + η v,即强度 α = η 的 DiM(Remark 4.1)。
    • 实验用的归一化:Algorithm 2 与全部实验使用 x ← x + η ∇F(x)/∥∇F(x)∥(梯度非零时)。先把 ∇Π − λ(x − x_0) 组成后再归一化,η 是激活空间中的绝对步长。线性核、λ = 0 时为 x + η v/∥v∥,对应 α = η/∥v∥ 的 DiM 族(Remark 4.2)。
    • 与 MMD:Proposition 4.3 称总体分数 Π_∞(x) 是 q_B 对 q_A 的未归一化 MMD 见证函数,经验分数 Π 是其插件估计,Algorithm 2 对该估计做梯度上升。特征核(高斯 RBF、Laplace)下,Π_∞ 恒为 0 当且仅当两分布相等;线性核只在均值相同时为零。带宽默认用 MMD 中位数启发式:σ 取 A ∪ B 成对欧氏距离的中位数。

    RBF 实例与一步上升

    • 核:k(x, y) = exp(−∥x − y∥² / (2σ²))。相似度随欧氏距离衰减,参考点的影响半径约为 σ。梯度为 ∇_x k(x, y) = σ^{−2} k(x, y) (y − x)。
    • Algorithm 2:初始化 x ← x_0;每步先算相似度加权的目标吸引与源排斥,再减去 λ(x − x_0),然后沿单位方向走 η。有效方向是 n_A + n_B 个成对力的加权合成,随 x 移动而变,不能收成单一固定向量。
    • 保证:Theorem 4.4 给出归一化一步严格增大 F 的充分步长上界,条件是核 Hessian 的算子范数有界。Corollary 4.5 在参考点与迭代点都落在半径 R 的球内时,给出 RBF 的对应上界。作者称这些界可能偏保守,实践中把 η 当超参数调节;梯度为零则方向无定义并停止。

    评测协议中的设计选择

    • 越狱:三个指令模型。128 条有害提示来自 AdvBench、MaliciousInstruct、TDC2023、HarmBench,128 条无害提示来自 Alpaca。参考、验证、测试不相交。在 39 条有害验证提示上最大化 ASR,约束是 256 条 Alpaca 验证困惑度 ≤ 未转向值的 1.05 倍。测试为 100 条 JailbreakBench、另 256 条 Alpaca,以及 TinyBenchmarks。ASR 由 Llama-Guard-3-8B 判定。
    • CAA:沿用对比选择题,激活取在答案 token 位置。每个行为保留 50 道留出测试题,验证 50 题,其余作参考。层与强度按验证集上行为一致答案概率最大来选。实验用 Gemma-2-9B-IT 的第 22 或 23 层,并比较无系统提示、鼓励该行为的正提示、抑制该行为的负提示。
    • 图像:512 条 COCO Captions 训练提示,风格标签由 Llama 3-8B-Instruct 生成;原文提示为源、加风格提示为目标。KAS 顺序施加。60 条 COCO 验证提示上,用 0-shot 分类分作风格诱导代理,用与原文提示的 CLIPScore 衡量内容保持,对照 Mean-AcT。
  4. 论文做了哪些实验?

    越狱、CAA 与图像风格三类主实验,外加核近似和单对比对。

    实验设置

    • 被测模型:越狱与单对比对为 Gemma-2-9B-IT、Llama-3.1-8B-Instruct、Qwen2.5-7B-Instruct。CAA 为 Gemma-2-9B-IT。图像为 FLUX.1 [schnell]。风格标签由 Llama 3-8B-Instruct 生成。ASR 评审为 Llama-Guard-3-8B。全部实验在一张 NVIDIA H100 96GB 上完成。
    • 数据规模:越狱参考集各 128 条有害与无害提示;验证 39 条有害提示与 256 条 Alpaca;测试 100 条 JailbreakBench 与另 256 条 Alpaca,另有 TinyBenchmarks。CAA 每行为 50 道测试题、50 道验证题。图像用 512 条训练提示构造参考,60 条验证提示出图。
    • 基线:越狱与 CAA 为 ActAdd、Curveball、CHaRS;图像为 Mean-AcT。CHaRS 报告三种子的均值和标准差,种子改变聚类初始化。ActAdd、KAS、Curveball 在固定数据与超参数、贪心解码下确定。
    • 指标:ASR(百分比)、Alpaca 困惑度(越低越好)、TinyBenchmarks 的 tArc、tHella、tMMLU、tQA、tWino。CAA 为行为一致答案的平均概率(%)。图像为 0-shot 风格分类分与 CLIPScore。单对比对另测 The Pile 与 Alpaca 的困惑度。
    • 选择规则:越狱在验证 ASR 最大且 Alpaca 验证困惑度不超过未转向 1.05 倍的设置上报告。CAA 按验证集行为一致概率选择层与强度。论文未报告主实验的具体层号、η、σ 与 T,除单对比对消融在 Figure 5 标注层与步数。
    • 重复:CHaRS 与 Nyström-KAS 为三种子;单对比对为 10 个随机有害–无害对。主表中 ActAdd、KAS、Curveball 无 ±。

    主结果

    Table 1 为验证选出设置下的越狱 ASR、Alpaca PPL 与 TinyBenchmarks(百分比;PPL 越低越好)。

    表格较宽,可左右滑动

    模型方法ASRPPLtMMLU
    Qwen2.5-7B-InstructActAdd91.006.7065.12
    Qwen2.5-7B-InstructKAS96.006.6064.16
    Gemma-2-9B-ITActAdd76.0010.1763.85
    Gemma-2-9B-ITKAS86.0010.0372.38
    Llama-3.1-8B-InstructActAdd94.006.4365.53
    Llama-3.1-8B-InstructKAS94.006.8165.40
    Qwen2.5-7B-InstructCHaRS92.33±1.537.89±0.0672.67±0.00
    Llama-3.1-8B-InstructCurveball0.005.6163.83
    • 作者解读:KAS 在 Gemma、Qwen 上 ASR 最高,分别比 ActAdd 高 10 与 5 个百分点,困惑度略低。Llama 上 KAS 与 ActAdd 同为 94%,困惑度更高;CHaRS 为 95.00±1.73,困惑度再升高。
    • 效用:作者称若干基线在个别效用任务上更高,但在其选出设置上 ASR 低得多。Table 1 中 Curveball 的 ASR 为 Qwen 2.00、Gemma 0.00、Llama 0.00,同时多项 TinyBenchmarks 高于 KAS,例如 Qwen 的 tMMLU 为 71.13 对 KAS 的 64.16。
    • 验证网格:作者称所测验证网格上,Llama 的 Curveball ASR 至多为 2.6%;Gemma 与 Qwen 的 Curveball 只在超过验证困惑度上限时才有高 ASR。比较限于已评测配置。

    CAA 行为转向

    Table 2 是负系统提示下、验证选出设置的行为一致答案概率(%)。

    • 测了什么:Gemma-2-9B-IT,六种行为,对比未转向、ActAdd、Curveball、CHaRS 与 KAS。
    • 结果:KAS 在 Corrigibility、Hallucination、Myopic Reward 上比线性对比加法高 9.63、11.04、8.92 个百分点,对应概率为 43.45、55.01、58.48,ActAdd 为 33.82、43.97、49.56。AI Coordination 上 KAS 为 40.19,ActAdd 为 39.51。Survival Instinct 与 Sycophancy 上 KAS 为 43.83 与 53.69,未转向为 43.68 与 53.18。
    • 作者解读:KAS 在 AI Coordination、Corrigibility、Hallucination、Myopic Reward 上概率最高;后两种行为接近未转向,作者将其视为近零效应。

    图像风格控制

    • 测了什么:cyberpunk 风格,干预强度变化下的 0-shot 风格分与相对原文提示的 CLIPScore,对照 Mean-AcT(Figure 3)。Figure 4 给出 λ ∈ {0.2, 0.4, 0.6, 0.8, 1.0} 的定性例子。正文横轴写 η,图注 x 轴写 λ,二者名称不一致。
    • 结果:Figure 3 的坐标为风格分与 CLIPScore 对干预强度,图例为 Mean-AcT 与 KAS;轴上可见 0.1、1、10 以及 0-shot 侧约 0.70–1.00、CLIPScore 侧约 0.10–0.25。论文未在正文给出各点的精确读数。
    • 作者解读:作者称 KAS 在多数强度上 0-shot 风格分高于 Mean-AcT;靠近 λ = 1 时风格分高且 CLIPScore 仍高。作者称 Figure 4 中更强干预带来更多 cyberpunk 视觉属性。图中具体像素差异无法从文本确认。

    其他消融与分析

    • Nyström 越狱(Table 3,64 landmarks,三种子):Qwen ASR 从 KAS 的 96.00 降到 22.33±0.47,PPL 从 6.60 到 6.54±0.06;Gemma 从 86.00 到 54.67±0.94;Llama 从 94.00 到 3.00±0.82。各变体使用各自验证选出的层与强度。
    • Nyström CAA(Table 4,负系统提示):AI Coordination 从 40.19 到 42.18±1.39,Corrigibility 从 43.45 到 51.80±1.86;Hallucination 从 55.01 到 54.13±0.09,Myopic Reward 从 58.48 到 55.26±0.86。Survival Instinct、Sycophancy 仍接近,KAS 为 43.83 与 53.69,Nyström-KAS 为 43.76±0.03 与 53.23±0.06。
    • 作者对近似的解读:近似降低三个模型的越狱 ASR,Alpaca 困惑度略低;CAA 上效果依任务而变。作者称这些结果没有确立精确核评估的统一替代,也没有量化计算节省。
    • 单对比对(Figure 5,10 对):层为 Gemma 22、Llama 12、Qwen 18。图中标注的平均 ASR:Gemma 上 ActAdd 69.80、一步 KAS(步长 200)68.30、十步 KAS(步长 40)69.40;Llama 上 85.60、75.60(一步,步长 5)、80.00(十步,步长 1);Qwen 上 91.00、86.80(一步,步长 40)、87.40(十步,步长 8)。同图标注的平均 Pile PPL:Gemma 21.71、17.42、19.47;Llama 14.81、10.97、11.28;Qwen 12.27、9.85、10.10。平均 Alpaca PPL:Gemma 12.14、10.41、11.27;Llama 7.48、6.41、6.55;Qwen 15.85、10.05、10.73。
    • 作者对单对比对的解读:KAS 在效用上好于 ActAdd,ASR 仍有竞争力。Gemma 上一步与十步平均 ASR 相近,Pile 与 Alpaca 困惑度更低。Qwen 上 ASR 与 ActAdd 相当,两套语料困惑度更低。Llama 上 ActAdd 的 ASR 最高,KAS 的困惑度更低。
    • 负面与例外:Llama 主结果上 KAS 并未高于 ActAdd(同为 94.00 ASR,PPL 6.81 对 6.43)。Curveball 在 Table 1 选出设置上 ASR 为 0 或 2。CAA 的 Survival Instinct 与 Sycophancy 近零。Nyström 在越狱上 ASR 下降,在部分 CAA 行为上上升。
  5. 有什么可以进一步探索的点?

    作者指出统一步数浪费算力,核选择与自适应选层仍开放。

    作者指出的局限与后续方向

    • 统一步数:KAS 对每个 token 使用相同的梯度上升步数;作者称这对已接近目标流形的 token 浪费计算,对更难的 token 可能不够(Conclusion)。
    • token 自适应计算:作者认为 token 自适应的计算日程可能会同时改善效率与稳定性(Conclusion)。
    • 核函数选择:作者称 RBF 是可靠的默认核,但按具体转向任务或要求选择核函数的原则性方法,仍是未来可探索的方向(Conclusion)。
    • 后续工作范围:作者称将 KAS 视为走向更有原则、几何感知的推理时控制的一步,并为核设计与自适应层选择上的进一步工作留出空间(Conclusion)。

    实验覆盖范围

    • 越狱主实验:三个指令模型,参考集各 128 条,测试 100 条 JailbreakBench;基线为 ActAdd、Curveball、CHaRS;ASR 由 Llama-Guard-3-8B 判定,效用含 Alpaca PPL 与 TinyBenchmarks(Section 5.1、Table 1)。
    • CAA:仅 Gemma-2-9B-IT,层 22 或 23;Table 2 报告负系统提示下六种行为、每种 50 道测试题。正文写明还设置了无系统提示与正系统提示,这两类条件的数字未在 Table 2 中给出。
    • 图像:FLUX.1 [schnell],cyberpunk 的 Figure 3 与 Figure 4;60 条 COCO 验证提示,对照 Mean-AcT。正文未列出 Figure 3 各强度的精确分数。
    • 消融:Nyström 使用 64 个 landmarks、三种子(Table 3、Table 4);单对比对为 10 个随机对,Figure 5 给出三模型的层、一步与十步及图上标注的均值。作者称近似实验不量化计算节省。
    • 理论与实现:Appendix A.1 给出一步上升的证明;带宽采用 MMD 中位数启发式。主实验的具体 η、σ、T 与干预层,除 Figure 5 标注的单对比对设置外,论文未在正文逐项列出。
  6. 总结一下论文的主要内容

    KAS 用核梯度做局部自适应转向,并在线性核下恢复 DiM。

    Kernelized Activation Steering(KAS) 把推理时的激活转向写成核空间中的优化,使更新随当前激活相对源、目标参考集的位置而变化。

    • 问题:DiM 用均值差得到与输入无关的平移。作者认为多模态或弯曲的激活结构下,这一全局向量可能把激活送入没有目标语义的区域,加大强度也不能分开不同模态。
    • 方法:隐式分数是对目标参考点的平均核相似度减去对源参考点的平均核相似度,对应 MMD 见证函数的插件估计。优化该分数并带近端项;实验采用归一化梯度。高斯 RBF 给出闭式力:相似的目标点吸引、相似的源点排斥。线性核、无正则时恢复 DiM。带宽用成对距离中位数。多数实验 λ = 0,且常只走一步。
    • 越狱:验证选出、且 Alpaca 验证困惑度不超过未转向 1.05 倍的设置下,Table 1 中 KAS 的 ASR 为 Qwen 96.00、Gemma 86.00、Llama 94.00;ActAdd 为 91.00、76.00、94.00。Llama 上 KAS 的 Alpaca PPL 为 6.81,ActAdd 为 6.43。Curveball 在该表中 ASR 为 0.00 或 2.00。
    • 行为与图像:负系统提示下,KAS 在四个有响应的 CAA 行为上概率最高,Myopic Reward 为 58.48%;Survival Instinct 与 Sycophancy 接近未转向。作者称 cyberpunk 风格上,KAS 在多数干预强度的 0-shot 风格分高于 Mean-AcT,且靠近 λ = 1 时 CLIPScore 仍高。
    • 消融与结论:64 landmarks 的 Nyström 把越狱 ASR 降到 Qwen 22.33±0.47、Gemma 54.67±0.94、Llama 3.00±0.82,同时部分 CAA 行为上升。单对比对、10 个种子时,Figure 5 中 KAS 的平均 ASR 接近或低于 ActAdd,Pile 与 Alpaca 平均困惑度更低。作者的结论是:KAS 严格推广 DiM,并留下核设计、自适应选层,以及按 token 分配梯度步数这几项后续工作。
阅读原文arxiv.org