跳到正文
原文
arXiv· arXiv:2609.36434· Benoit Dherin·本站收录 · 原文发表

研究提出 Safety Operator:用谱优化调节安全指令的表达强度

The Safety Operator: Modulating the Expression of Safety Instructions via Spectral Optimization

论文速读

防御

据论文 PDF 整理(AI 生成),以原文为准

论文提出 Safety Operator,用抑制权重 ρ 调节安全指令特征值,在 Gemma 3 1B 的扩展 JBB 上扫出 ASR–ORR 权衡,并在部分参数化下得到 Pareto 改进。

威胁模型优化者改写安全指令 Y 或其后缀,使 Safety Operator 的特征值 λsafe 在有害查询上增大、在无害查询上靠近 1。

问题
手写安全指令靠试错,缺少形式化目标来同时压低有害请求的攻击成功、又避免无害请求被过度拒绝。
方法
把安全指令吸收成秩 1 的 Safety Operator,用 Contrastive Safety Loss 与抑制权重 ρ 调节特征值 λsafe,并在 Soft、Mixed、Hard GCG、HardR 四种参数化上优化。
实验与结果
在 Gemma 3 1B 的扩展 JBB 上,扫 ρ 得到 ASR–ORR 曲线。Soft 与 Hard GCG 的训练中 Pareto 点大多在测试集确认;Mixed 只有近 Pareto;去掉 Short SI 使 ASR 从 13.81% 升到 26.53%。
局限与可以继续做的
作者称实验只用 Gemma 两档规模和两种指令模板,OOD 迁移依赖参数化与数据集,且超参偏向降低分布内 ASR。被测为 Gemma 3 1B/4B,主协议为扩展 JBB 的 100 对三分,R=5、K=5。
实验设置Gemma 3 1B、Gemma 3 4B · JailbreakBench (JBB) extended 300 pairs、AdvBench 等 · ASR、ORR 等
威胁模型
优化者改写安全指令 Y 或其后缀,使 Safety Operator 的特征值 λsafe 在有害查询上增大、在无害查询上靠近 1。知识为白盒激活与梯度(Hard GCG/HardR/Soft/Mixed)。受害系统是带系统前缀与安全指令的 Gemma;不改模型权重。成功由 ASR 下降与 ORR 不升判定。
模型
Gemma 3 1BGemma 3 4B
基准
JailbreakBench (JBB) extended 300 pairsAdvBenchXSTest
指标
ASRORRΔASRΔORR
AI 导读全文 214 字

论文研究 Transformer 语言模型中上下文 token 被吸收进权重后形成的乘性算子,并证明影响其主特征值可以调节安全指令对生成的影响强度。作者据此推导出带抑制权重的对比安全损失,在有害查询上强化安全指令、在无害查询上抑制它。改变抑制权重可刻画攻击成功率与过度拒答率之间的关系,支持算子特征值充当指令影响力的连续调节旋钮这一假设。该关系在安全损失参数化方式不同时仍相对成立,在合适的抑制权重下可得到帕累托改进的安全指令。

深度解读

6 个问题,约 9,100 字。每问先给一句结论,点开看完整回答

  1. 这篇论文试图解决什么问题?

    用特征值把安全指令的表达强度做成可调旋钮,兼顾拒答与少误拒。

    如何用可计算的目标调节安全指令,使有害请求上表达更强、无害请求上接近不起作用。

    • 场景:作者称系统提示词会条件化大语言模型行为,但机制不清楚。生产中的安全指令(safety instruction, SI)靠手写和试错,没有形式化数学目标来指导措辞,既要拒绝有害请求,又要避免过度拒绝无害请求。
    • 现有不足:作者把表示工程、激活加法、条件路由和注意力加权等归为在残差流注入静态或带门控的方向;这些干预不优化提示词本身。RLHF、软提示和外部监控则改策略、改上下文或在模型外过滤。作者称现有提示优化缺少从算子谱结构导出的对比抑制项。
    • 核心观察:连续上下文 token 可被吸收进 MLP 权重,成为乘性算子。对安全指令 Y,Safety Operator 为 S(Y)=I+Δq(Y),是恒等矩阵的秩 1 扰动,只沿安全方向以特征值 λsafe 拉伸。作者假设调节该主特征值能连续控制指令对生成的影响。
    • 本文做法:导出带抑制权重 ρ 的 Contrastive Safety Loss,在有害查询上抬高 λsafe、在无害查询上把它拉向 1。并在 Soft、Hard GCG、HardR、Mixed 四种参数化上扫 ρ,检验 ASR 与过度拒绝率(ORR)的权衡,以及是否出现相对原指令的 Pareto 改进。作者称目标是引入这一数学工具,竞争性基准对比留作后续。
    • 威胁模型:
      • 目标:给定有害查询 β+ 与无害查询 β−,最大化有害查询上的 λsafe,并把无害查询上的 λsafe 驱向 1,从而降低 ASR 且不增加 ORR。
      • 知识:损失定义在内部激活上,连续方法用梯度下降,Hard GCG 把安全梯度投影到嵌入矩阵做单 token 替换;论文未用 no-box/black-box/white-box 这些词描述该设置。
      • 能力:优化者改写安全指令的连续嵌入(Soft)、在冻结的人工指令后追加离散或连续后缀(Hard / HardR / Mixed);系统前缀 α 固定。不修改模型权重 W。
      • 受害系统:带提示结构 [α, Y, β] 的指令模型。主实验为 Gemma 3 1B,附录用 4B。成功由前沿模型 autorater 把回复分成遵从或拒绝,再算 ASR 与 ORR。
  2. 有哪些相关研究?

    工作接在上下文即隐式权重更新之上,并对照引导、对齐和提示优化。

    论文把相关工作分成上下文学习的隐式更新,以及引导、条件路由、注意力加权和安全对齐/提示优化。

    上下文即隐式权重更新

    • Dherin et al. (2025)、Innocenti & Achour (2025)、Goldwaser et al. (2026):把一段上下文 token 对查询 token 的作用吸收成 transformer MLP 权重上的乘性更新。本文在此框架上定义 Safety Operator。
    • von Oswald et al. (2023)、Akyürek et al. (2023)、Geva et al. (2021):上下文学习与前馈层作为键值记忆的基础理论。论文称在此基础上延伸到安全对齐。
    • Arditi et al. (2024):作者称其表明对齐模型的拒绝主要由残差流中的一维子空间中介。本文把指令效应写成与查询相关的乘性算子,而不是单一固定拒绝方向。

    激活引导、条件路由与注意力加权

    • RepE(Zou et al., 2023a)、Activation Addition(Turner et al., 2023)、CAA(Rimsky et al., 2024)、ITI(Li et al., 2023):从对比提示抽出固定方向并加进残差流。后续有 PID Steering(Nguyen et al., 2026)、Refusal Steering(García-Ferrero et al., 2026)、RepIt(Siu et al., 2026)。
    • CAST(Lee et al., 2025)、SCANS(Cao et al., 2025)、ELS(Jiang et al., 2026):用相似度开关、层分类器或能量模型决定何时、多强地干预。作者称它们不改系统提示,而是外挂运行时控制器。
    • PASTA(Zhang et al., 2024a)、SEKA(Li et al., 2026)、InstABoost(Guardieiro et al., 2025)、SpotLight(Venkateswaran & Contractor, 2026):在推理时重加权指向指令的注意力。Task Arithmetic(Ilharco et al., 2023)与 Hendel et al. (2023) 的 task vector 则在权重或演示压缩侧。作者称 Safety Operator 像依赖输入的加性引导,但是前向过程里隐含的,不是训练时注入。

    安全对齐与提示优化

    • RLHF(Ouyang et al., 2022)、RepBend(Yousefpour et al., 2025):通过微调永久改权重。Constitutional Classifiers(Cunningham et al., 2026)与 Kramár et al. (2026) 的探针在模型外或激活上做监控。作者称这些与提示级谱优化互补,位于部署栈的不同层。
    • DRO(Zheng et al., 2024):连续嵌入上对有害/无害查询做对比,作者称行为目标最接近 Soft。RPO(Zhou et al., 2024)搜索空间类似 Hard GCG,但是优化最坏情况鲁棒性,没有对比抑制项。DefensiveTokens(Chen et al., 2025)接近 Mixed,但没有固定的 SI 区间。作者称 HardR 没有直接对应方法。
    • 攻击与任务提示优化:GCG(Zou et al., 2023b)、AutoPrompt(Shin et al., 2020)、AutoDAN(Zhu et al., 2024)、PAIR(Chao et al., 2023)、AmpleGCG(Liao & Sun, 2024)、Crescendo(Russinovich et al., 2024),以及 OPRO、Promptbreeder、ProTeGi、DSPy。作者称本文把优化用于防御,目标来自内部谱结构,而不是输出似然或黑盒奖励。附录还提到 SmoothLLM、SafeDecoding、自提醒模板、软提示(Lester et al., 2021;Li & Liang, 2021)等,作为对齐技术谱系,未逐项当作实验基线。

    基线与基准

    • 基线方法:No-SI(S=Id,去掉安全指令)与未调制的 Original SI(Short SI;附录另有 Long SI)。不是与 DRO、RPO、DefensiveTokens 的同表竞技。
    • 基准/数据集:由 JailbreakBench(JBB;Chao et al., 2024)扩展的 300 对有害/无害查询,分成 train/eval/test 各 100 对。附录 K 用 AdvBench(Zou et al., 2023b)与 XSTest(Röttger et al., 2024)做分布外评估。

    作者把本文定位为:用 Safety Operator 理解并控制指定提示区间如何塑造生成,重点是该工具本身;与已有 steering 和 prompt-defense 的竞争性基准对比留作后续。附录中作者称,相对 DRO,Soft 的谱优化似乎降幅更小,但泛化更好(“seems to”)。

  3. 论文如何解决这个问题?

    用秩 1 Safety Operator 的 λsafe 构造对比损失,并在四种参数空间里优化。

    整体思路是把安全指令 Y 对残差流的作用写成 Safety Operator S(Y)=I+Δq(Y),再用 Contrastive Safety Loss 按查询类别调节其主特征值 λsafe。损失与搜索算法分离:优化对象是特征值,参数化可以是连续嵌入、离散 token 或混合后缀。

    问题设定与算子

    • 提示结构:提示为 [α, Y, β]。α 是固定系统前缀,Y 是安全指令,β 是用户查询。后缀方法把后缀 S 接在 Y 后,以 [Y, S] 作为有效安全指令。
    • 激活差:Aclean 是不含 Y 时、查询 token q 进入前馈层的激活;Asafe 是含 Y 时的对应激活。上下文向量 δq(Y)=Asafe−Aclean。
    • 最小权重更新:要在不含 Y 的模型里复现指令效果,需 (W+ΔW)Aclean=W Asafe。作者引用 Dherin et al. (2025) Theorem 2.3,最小 Frobenius 范数更新抽出后得到 S(Y)=I+Δq(Y),且 S(Y)Aclean=Asafe。S(Y)=I 表示指令无效果。
    • 计算位置:S(Y) 在生成开始前的最后一个查询 token 上计算。作者把 λsafe 称为安全指令版的注意力劫持“dominance score”的对应量(对照 Ben-Tov et al., 2026),其他位置留作后续。

    谱结构与对比损失

    • 特征值:Δq(Y) 是秩 1,故只沿安全方向 δq(Y) 拉伸,与 Aclean 正交的 d−1 维子空间特征值为 1。Lemma A.1 给出 λsafe=1+tr(Δq(Y))。越接近 1,越接近恒等、指令越弱。
    • 几何分解:λsafe=(∥Asafe∥/∥Aclean∥) cos θ,即幅度比乘方向对齐。作者称实践中 cos θ≃1,因此取 f(λsafe)=g(λsafe)=λsafe²。
    • 损失:对严格单调增的 f,以及满足 g(1)=1、g′(1)>0 的 g,

    Lsafety(Y)=Eβ+[−f(λsafe)]+ρ Eβ−(1−g(λsafe))2

    第一项抬高有害查询上的 λsafe;第二项惩罚无害查询上偏离 1。ρ>0 是抑制权重:小 ρ 更强调安全表达、过度拒绝更高;大 ρ 在无害查询上迫使 S(Y)≈I。多层损失是 Lstart 到 Lend 上 Lsafety 的平均。连续方法另加 L2 正则(附录 C、D)。

    • 作者未展开的替代目标:也可优化 ∥Δq(Y)∥F、S(Y) 的谱范数,或把表达项与抑制项写成凸组合。更高阶损失形状留作后续。

    四种参数化

    • Soft:对整段安全指令嵌入 EY 做连续梯度下降,token 嵌入联合更新,得到不能写成可读文本的软指令。算法在附录 C。
    • Hard GCG:冻结原始 SI,用 Greedy Coordinate Gradient(Zou et al., 2023b)优化离散后缀,把安全梯度投影到嵌入矩阵做单 token 替换。附录 E。
    • HardR:在 Hard 上加改编自 AutoDAN(Zhu et al., 2024)的可读性正则,从人工种子出发,按安全–可读联合分数采样突变,得到相对流利的英文后缀。附录 F。
    • Mixed:在冻结的人工指令后优化连续后缀嵌入。附录 D。Figure 1 中蓝色为被优化部分。

    训练与选择协议

    • 数据:100 对不够做三段划分,故用前沿模型把 JBB 扩到 300 对有害/无害,再用贪心多目标分配分成 train/eval/test 各 100 对,使伤害类别比例以及 ASR、ORR 难度档在各段上接近。附录 H。
    • 起点:所有运行从 Short SI 出发,句子来自 HHH 原则(Askell et al., 2021),要求有用、诚实、无害并拒绝危险、有毒或不道德内容。更长变体在附录 G、J。
    • 扫参:每种参数化扫 16 个 ρ,范围 [0, 5000],学习率、层范围等固定为在 eval 上选定的默认值。训练中按 eval 上的检查点记录 ASR–ORR;保留所有相对 Original SI 满足 ΔASR<0 且 ΔORR<0 的检查点,而不是只留最后一步。
    • 判定:测试时用前沿模型 autorater 把 Gemma 的回复分为遵从或拒绝。每个提示 R=5 次独立生成,温度 T=0.7;每次回复再经 K=5 次 autorater(温度 0)多数表决(≥3)。报告相对同一随机种子上 Original SI 的配对均值,以及学生 t 分布(ν=4)的 95% 置信区间。附录 I。
  4. 论文做了哪些实验?

    四种参数化在 Gemma 3 1B 上扫 ρ;Soft 与 Hard GCG 的 Pareto 点大多能在测试集确认。

    作者用三个预测检验理论:扫 ρ 应走出 ASR–ORR 连续曲线;中间 ρ 应出现相对原 SI 的双指标改进;该现象应在四种参数化上成立。

    实验设置

    • 模型:主文 Gemma 3 1B(Gemma Team, 2025);附录 J 复现 Gemma 3 4B,并比较 Short SI 与 Long SI。
    • 数据:扩展 JBB,300 对,train/eval/test 各 100 对。作者称各分段基线接近:ASR 约 14–15%,ORR 约 18–19%。去掉 Short SI 后 ASR 从 13.81% 升到 26.53%,ORR 从 19.59% 降到 11.59%。
    • 方法变体:Soft、Mixed、Hard GCG、HardR。ρ∈[0, 5000] 共 16 个值,其余超参在 eval 上固定。
    • 基线:No-SI(S=Id)与 Original SI。作者称这是隔离谱调制效应的因果基线,不与外部防御方法竞技。
    • 指标与评审:ASR 为有害查询上的攻击成功;ORR 为无害查询上的过度拒绝。前沿模型 autorater 做遵从/拒绝分类;R=5,T=0.7,K=5 多数表决。附录 I.2 报告 autorater 配置与遍间一致性,正文未给出具体一致率数字。
    • 统计:测试集上对 eval 选出的候选重评,配对 Δ 的 95% CI,自由度 ν=4。Pareto 改进定义为点估计 ΔASR<0 且 ΔORR<0。

    主结果

    主文数字是相对 Original SI 的测试集差值(Gemma 3 1B,Short SI,R=5)。绝对 ASR/ORR 除 Mixed 的一个候选外,论文未在正文逐候选列出。

    表格较宽,可左右滑动

    参数化训练中 Pareto 点测试确认作者标出的候选
    Soft1110(90.9%)ρ=10,step 235:ΔASR=−3.86%,CI [−6.73%, −0.99%];ΔORR=−4.04%,CI [−6.98%, −1.10%]
    Hard GCG1110(90.9%)ρ=5,step 125:ΔASR=−2.81%,CI [−4.33%, −1.29%];ΔORR=−3.59%,CI [−6.23%, −0.94%]
    HardR6531(47.7%)ρ=350,step 200:ΔASR=−2.96%,CI [−4.30%, −1.62%];ΔORR=−0.82%,CI [−9.58%, +7.94%]
    Mixed0(严格)近 Pareto 10 个均未成严格改进ρ=2000,step 45:ASR=9.13%,ORR=20.92%;ASR 降幅最高到 ΔASR=−4.68%,ORR 为 +1.05% 到 +1.89%

    据 Section 5.2 与 Figure 2、Figure 3。

    • 预测 1:作者称左图在四种参数化上都呈连续表达–抑制曲线。ρ≤5 时 ASR 降到 2% 以下,ORR 升到 50% 以上;ρ≥1000 时轨迹靠近 Original SI。
    • 预测 2:Soft、Hard GCG、HardR 的中间 ρ 进入绿色 Pareto 象限。Mixed 在 1B+Short SI 上没有严格 Pareto 点:凡降低 ASR 的检查点都有轻度 ORR 上升。作者评估 eval 上 ΔORR≤1.5 个百分点、最靠近边界的 10 个近 Pareto 候选;测试集上 ASR 下降的 CI 不含 0,ORR 上升不显著。作者认为冻结指令旁的连续后缀带来轻度过度拒绝偏差。
    • HardR 例外:未优化语义种子(step 0)ΔASR=−3.75%,但 ΔORR=+5.96%。作者称仅靠种子不够,谱优化有助于消掉过度拒绝的上升。另一候选 ρ=100、step 75:ΔASR=−1.11%,ΔORR=−4.47%,CI [−9.53%, +0.59%],作者称这是离散方法里最大的 ORR 降幅,但其 CI 含 0。总优候选的 ORR CI 也含 0,作者称之为 ASR 显著下降、过度拒绝中性。

    轨迹形态与 4B / 长指令

    • 连续与离散:作者称连续嵌入轨迹平滑,离散坐标搜索呈跳跃;可读后缀在语法破碎下仍保留部分词汇连贯。作者认为谱抑制不依赖于对抗性 token 异常。Figure 3 注:HardR 右图画出全部评估池,深红色为测试集上仍 Pareto 改进的子集,未确认者变淡。
    • 附录 J:作者在 Gemma 4B 与 Long SI 上做补充。正文称优化长指令的全部连续嵌入会过拟合 eval、抬高测试 ORR;把适配限制在短后缀或加正则可减轻(Appendix J.2)。具体 4B 表格数字在被截断的附录表格中列对齐不可靠处不转写。
    • 与 DRO:作者称附录 B–B.5 的比较里,DRO 似乎降幅更强、泛化更弱。这是作者的概括,正文未给出与 DRO 并排的完整数字表。

    分布外:AdvBench 与 XSTest

    附录 K 用主实验选出的候选做 OOD,不参与训练或选择。Figure 8:Original SI 在 AdvBench 上 ASR 为 16.03%,No-SI 为 25.08%。97 个 JBB 候选中 71 个(73.2%)仍低于 Original SI。作者称 Soft 的 11 个候选全部低于该基线,最强者为统计上显著的 −8.62 个百分点;Hard GCG 与 HardR 迁移面更宽但方差更大;Mixed 基本中性。

    XSTest 取类别 1–4 的 100 条有害与 100 条良性查询。Original SI 把 ASR 压到 1.11%,ORR 升到 44.09%。

    表格较宽,可左右滑动

    方法池AdvBench 方向(作者对 Figure 8)XSTest 最佳 ΔORRXSTest 点估计 PI
    Soft11全部低于 Original SI;最强 −8.62 pp+5.56 pp(无下降)0/11
    Mixed10作者称基本中性+12.83 pp(无下降)0/10
    Hard GCG11迁移面更宽、方差更大−10.69 pp(CI 不含 0)3/11
    HardR65同上−12.29 pp(CI 不含 0)3/65

    据 Table 25、Table 26。连续方法把 ASR 压近 0,但 ORR 相对 Original SI 上升约 +5.56 到 +14.51 个百分点(Table 26 的最佳列是升高)。离散后缀相反:部分候选 ORR 下降。没有任何候选在 ASR 与 ORR 的 95% CI 上同时不含 0。作者认为这与 1.11% 的 ASR 地板限制了 ΔASR 的统计功效一致,也与超参按最大降低 JBB ASR 来选、从而偏向抑制 ASR 一致。

    其他消融与分析

    • ρ 两端(四种参数化,eval 轨迹):ρ≤5 时 ASR<2%、ORR>50%;ρ≥1000 时靠近 Original SI。
    • 去掉 SI:ASR 13.81%→26.53%,ORR 19.59%→11.59%。
    • HardR 种子 step 0:ΔASR=−3.75%,ΔORR=+5.96%。
    • Mixed 近 Pareto:测试集 ORR 升 +1.05% 到 +1.89%,ASR 降幅最高 ΔASR=−4.68%。
    • AdvBench:71/97 候选 ASR 低于 Original SI(16.03%)。
    • 层平均与 L2:损失在层区间上平均;Soft/Mixed 加 L2。正文未单列改变层范围或正则系数的结果表。
  5. 有什么可以进一步探索的点?

    作者指出仅 Gemma、两套模板,且 OOD 与超参选择会改变结论。

    作者指出的局限与后续方向

    • 模型与模板范围:实验只用 Gemma 一族、两个规模和两套安全指令模板。扩展到其他指令微调模型族、秩 1 近似可能更不准的更大规模,以及多轮设置,仍然开放(Limitations)。
    • OOD 不统一:验证分布外迁移的初步实验同时依赖参数化与数据集,没有任何一种参数化在所有 OOD 基准上均匀迁移(Limitations;Appendix K)。
    • 超参偏差:固定优化超参选自分布内 ASR 降得最多的配置,只扫抑制权重不一定总能补偿这一结构性偏差(Limitations)。
    • 长指令过拟合:优化长安全指令的全部连续嵌入会过拟合 eval 分段并抬高测试 ORR;限制在短后缀或加正则可以减轻(Limitations;Appendix J.2)。
    • 损失与算子空间:后续可试更高次 λsafe、扰动矩阵范数、训练中自适应调度表达–抑制平衡,以及直接优化固定 steering 向量、低秩残差适配器或激活扰动张量(Conclusion,方向 1–2)。其他 token 位置、其他损失形状也留作后续(Section 3.3,Remark 3.1–3.2)。
    • 跨行为域:数学形式与领域无关,对比谱优化原则上可用于与安全拒绝同结构的行为引导,但特征值在那些设置里是否仍是有用代理,作者称为未决的实证问题(Conclusion,方向 3)。与现有 steering、prompt-defense 的竞争性基准对比,作者明确留作后续(Introduction)。

    实验覆盖范围

    • 被测模型:主文 Gemma 3 1B;附录 J 为 Gemma 3 4B。安全指令为 Short SI,附录另有 Long SI。
    • 分布内协议:扩展 JBB 300 对,三段各 100 对;ρ 取 [0, 5000] 内 16 个值;四种参数化 Soft、Mixed、Hard GCG、HardR。测试生成 R=5、T=0.7,autorater K=5、温度 0,95% CI 用 ν=4。
    • 分布外:Appendix K 在 AdvBench 上报告 ASR,在 XSTest 类别 1–4(100 有害 + 100 良性)上报告 ASR 与 ORR;候选来自 JBB 的 eval 选择,共 97 个(11+10+11+65)。
    • 对照:分布内对照是 No-SI 与 Original SI。论文讨论了 DRO、RPO、DefensiveTokens、静态/条件 steering,并说明主实验不把它们当作同表竞技基线;与 DRO 的比较放在附录,作者称 DRO 降幅似乎更强、泛化更弱。
    • 论文未报告:正文未给出 autorater 的遍间一致率数值(只说写在 Appendix I.2);未报告各方法的查询次数或墙钟时间;未把层范围、学习率做成主结果表。
  6. 总结一下论文的主要内容

    Safety Operator 用 ρ 调节 λsafe,在 Gemma 上走出 ASR–ORR 权衡并得到部分 Pareto 指令。

    Safety Operator 把安全指令写成恒等矩阵的秩 1 乘性扰动,用主特征值 λsafe 当作指令表达强度的连续旋钮。

    手写安全指令缺少形式化目标。作者从上下文可吸收进 MLP 权重这一结果出发,定义 S(Y)=I+Δq(Y),只沿安全方向以 λsafe 拉伸。Contrastive Safety Loss 在有害查询上抬高该特征值,并用抑制权重 ρ 把无害查询上的特征值拉向 1。同一损失分别优化整段连续嵌入(Soft)、冻结指令加离散后缀(Hard GCG)、可读离散后缀(HardR)和连续后缀(Mixed)。

    在 Gemma 3 1B、由 JBB 扩展的各 100 对测试集上,扫 ρ∈[0, 5000] 得到 ASR–ORR 曲线:低 ρ 把 ASR 压到 2% 以下并使 ORR 超过 50%,高 ρ 回到原指令附近。Soft 与 Hard GCG 各有 11 个训练中 Pareto 点,10 个在测试集确认;Soft 最强候选(ρ=10,step 235)ΔASR=−3.86%、ΔORR=−4.04%,两者 95% CI 都不含 0。HardR 有 65 个训练中 Pareto 点、31 个确认,总优候选的 ASR 下降显著而 ORR 的 CI 含 0。Mixed 没有严格 Pareto 点。去掉 Short SI 使 ASR 从 13.81% 升到 26.53%、ORR 从 19.59% 降到 11.59%。AdvBench 上 97 个候选里 71 个 ASR 仍低于 Original SI;XSTest 上连续方法加重过度拒绝,离散方法里少数候选降低 ORR,但没有候选在两个指标的 CI 上同时不含 0。

    作者的结论是:调节该特征值与“它能控制提示表达”这一看法一致,并在目标分布上给出 Pareto 改进配置。作者同时写明,证据来自 Gemma 两档规模和两套模板,OOD 行为随参数化与数据集变化,且超参选择偏向降低分布内 ASR。

阅读原文arxiv.org