跳到正文
原文
论文追踪· arXiv:2606.04168· Bochen Lyu, Yiyang Jia, Xiaohao Cai, Zhanxing Zhu·本站收录 · 原文发表

论文提出随机插入攻击,利用自回归一致性绕过 LLM 安全对齐

When Autoregressive Consistency Hurts Safety Alignment

论文速读

分析与理论

据论文 PDF 整理(AI 生成),以原文为准

作者认为自回归一致性使安全对齐更新集中在早期token,短有害片段即可拐偏拒绝轨迹。

问题
安全对齐要让模型拒绝有害查询,但微调常只改前几个输出token,拒绝前缀之后仍可能脆弱。作者认为这与自回归一致性有关。
方法
分析学习动态,称自回归一致性把对齐更新集中到早期token。攻击例random insertion attack在拒绝轨迹插入短有害片段。对齐则用最坏有害延续状态,初步实现叫random worst-insertion attack。
实验与结果
作者称自回归一致性会使对齐更新集中在早期token。作者还称,短有害片段接在很长的拒绝前缀之后,仍可能把生成导向有害。
局限与可以继续做的
摘要没有把某项写成局限。作者把对齐实现称为初步的random worst-insertion attack,并认为对齐还应打断全程有害自回归一致性。
AI 导读论文《When Autoregressive Consistency Hurts Safety Alignment》提出,大语言模型的安全对齐之所以脆弱,部分原因在于它往往很浅层:微调主要改变模型在最初几个输出 token 附近的行为。作者用自回归一致性解释这一现象,即下一 token 预测倾向于保持并延续当前回复轨迹,学习动态分析显示对齐更新会集中在早期 token 上。同一机制还预测出一类更广泛的攻击,即在输出轨迹任意位置诱导出有害延续状态。作为具体例子,作者提出随机插入攻击,在原本安全的拒答轨迹中插入一小段有害内容,借助自回归一致性维持有害分支,从而绕过安全对齐;即便在很长的拒答前缀之后,一小段有害内容也能把生成引向有害方向。作者据此提出对抗式安全对齐框架,并实例化为随机最坏插入训练,主张安全对齐应打破整条输出轨迹上的有害自回归一致性。

论文《When Autoregressive Consistency Hurts Safety Alignment》提出,大语言模型的安全对齐之所以脆弱,部分原因在于它往往很浅层:微调主要改变模型在最初几个输出 token 附近的行为。作者用自回归一致性解释这一现象,即下一 token 预测倾向于保持并延续当前回复轨迹,学习动态分析显示对齐更新会集中在早期 token 上。同一机制还预测出一类更广泛的攻击,即在输出轨迹任意位置诱导出有害延续状态。作为具体例子,作者提出随机插入攻击,在原本安全的拒答轨迹中插入一小段有害内容,借助自回归一致性维持有害分支,从而绕过安全对齐;即便在很长的拒答前缀之后,一小段有害内容也能把生成引向有害方向。作者据此提出对抗式安全对齐框架,并实例化为随机最坏插入训练,主张安全对齐应打破整条输出轨迹上的有害自回归一致性。

深度解读

6 个问题,点开问题读完整回答

  1. 这篇论文试图解决什么问题?

    浅层安全对齐主要改前几个token,作者认为来自自回归一致性。

    安全微调主要只改前几个输出 token,对齐因此停在浅层。

    • 场景:安全对齐要让 LLM 拒绝有害查询下的有害内容。作者称通常靠 SFT [25]、DPO [19] 和 RLHF [3, 15];对齐模型在 prefill attack [1] 与 optimization based attacks [6, 14, 31, 32] 下仍脆弱。
    • 已有描述:引言称 Qi et al. [17] 将此与 shallow safety alignment 相连:安全微调主要改靠近前几个输出 token 的生成分布。回复若以常规 refusal prefix 开头,对齐模型可能仍安全。
    • 核心观察:作者认为可用 autoregressive consistency 理解,即 next-token prediction 会一致地保持并延伸当前轨迹(示意图 Def. 2.1 写当前分支)。作者称学习动态分析显示,对齐更新会因此集中到早期 token。
    • 本文做法:作者称这指向可在输出轨迹任意位置诱发有害续写的攻击,例子是 random insertion attack。作者认为对齐还应打断全程有害自回归一致性,并提出使用 worst-case harmful continuation states 的框架,初步实现为 random worst-insertion attack。
    • 威胁模型:
      • 目标:绕过安全对齐,让生成维持有害分支。
      • 能力:向原本安全的 refusal 轨迹插入短 harmful span。
      • 受害系统:已对齐 LLM。作者称很长的 refusal prefix 之后,短 harmful span 仍可能把生成导向有害。
  2. 有哪些相关研究?

    引言只涉及SFT、DPO、RLHF、prefill攻击和Qi等人的浅层对齐。

    引言里点到的工作分三组。

    安全对齐方法

    • SFT 与偏好优化:作者称安全对齐通常由 SFT [25],以及 DPO [19]、RLHF [3, 15] 实现,目标是面对有害查询时拒绝生成有害内容。

    对齐后仍脆弱的攻击

    • prefill attack 与优化类攻击:作者称对齐后的 LLM 在 prefill attack [1] 和 optimization based attacks [6, 14, 31, 32] 下仍然脆弱。引言只把它们列为对齐仍会失效的例子。

    浅层安全对齐

    • Qi et al. [17]:作者称上述脆弱与 shallow safety alignment 密切相关,即安全微调主要修改靠近前几个输出 token 的生成分布。

    作者把本文放在这条线上:用 autoregressive consistency 理解更新为何集中在早期 token,并讨论任意位置的有害续写,以及应打断全程有害一致性的对齐。

  3. 论文如何解决这个问题?

    作者分析学习动态,称更新会集中到早期token。

    作者用 autoregressive consistency 理解浅层安全对齐,并以 random insertion attack 说明有害续写可出现在拒绝轨迹中途,再提出基于 worst-case harmful continuation states 的对抗对齐。

    概念

    • 浅层对齐:作者称安全微调主要重塑前几个输出 token 附近的行为。引言转述 Qi et al. [17]:生成分布的改动也主要在这几个 token 附近。
    • 自回归一致性:next-token prediction 倾向于一致地保持并延伸当前回复轨迹。示意图把 Def. 2.1 写成保持并延伸当前分支。
    • 轨迹上的 token:示意图文字区分 prompt tokens、refusal tokens 与 harmful tokens,并标有 continuation。

    学习动态

    • 作者称分析了安全对齐的学习动态。
    • 作者称自回归一致性可使对齐更新集中在早期 token,并称这为浅层安全对齐提供机制性解释。
    • 示意图文字写:梯度更新集中在早期 token,在更后的 token 上较小;可见标注还有 gradient、consistency-driven、concentration。

    随机插入攻击

    • 在原本安全的 refusal 轨迹里插入一段短 harmful span。
    • 作者称自回归一致性会维持由此分出的有害分支,从而绕过安全对齐。
    • 作者称该片段即使位于很长的 refusal prefix 之后,仍可能把生成导向有害。
    • 作者把它视为更广一类的例子:在输出轨迹任意位置诱发有害续写。

    对抗安全对齐

    • 作者认为对齐还应打断输出轨迹全程的有害自回归一致性。
    • 框架采用 worst-case harmful continuation states。
    • 作者给出的初步实现称为 random worst-insertion attack。
  4. 论文做了哪些实验?

    摘要称短有害片段可在长拒绝前缀后把生成导向有害。

    摘要的结论是定性的:作者称短 harmful span 可在长 refusal prefix 之后把生成导向有害。

    实验设置

    • 摘要与第 1 节开头未列出被测模型、数据集、基线、指标、评审方式、样本量或重复次数。

    主结果

    摘要没有指标数字,下表只转述主张。

    作者主张文中条件出处
    对齐更新可集中在早期 token安全对齐的学习动态摘要
    短 harmful span 可维持有害分支并绕过对齐插入原本安全的 refusal 轨迹摘要
    长 refusal prefix 后仍可能导向有害生成random insertion attack摘要
    • 作者称更新集中为 shallow safety alignment 提供机制性解释。
    • 作者称很长的拒绝前缀也挡不住短 harmful span 把轨迹带向有害。
    • 作者认为自回归一致性应进入对齐和攻击两方面的设计。

    其他消融与分析

    • 摘要未给出消融变量或参数数字。
  5. 有什么可以进一步探索的点?

    作者把对齐实现称为初步的random worst-insertion attack。

    作者指出的局限与后续方向

    • 摘要和第 1 节开头没有明确写成局限或未来工作的句子。作者把对齐侧实现称为 practical initial implementation,即 random worst-insertion attack(摘要)。

    实验覆盖范围

    • 作者称分析了安全对齐的学习动态(摘要)。
    • 作者给出 random insertion attack,称短 harmful span 可维持有害分支,包括长 refusal prefix 之后(摘要)。
    • 作者提出采用 worst-case harmful continuation states 的对抗安全对齐,初步实现为 random worst-insertion attack(摘要)。
    • 摘要没有写出被测模型、基准、指标数值、样本量或评审方式。
  6. 总结一下论文的主要内容

    作者用自回归一致性串起浅层对齐、插入攻击和最坏延续对齐。

    作者把浅层安全对齐和一类续写攻击都归到自回归一致性上。

    • 问题:对齐常用 SFT、DPO 与 RLHF,但作者称微调主要改前几个输出 token。引言称这与 Qi et al. [17] 的 shallow safety alignment 一致;对齐模型在 prefill attack 和优化类攻击下仍脆弱。
    • 机制:下一步预测会保持并延伸当前轨迹。作者称因此对齐更新集中到早期 token。示意图文字也写梯度在早期 token 集中、在后续 token 较小。
    • 攻击:random insertion attack 把短 harmful span 插入安全的 refusal 轨迹。作者称很长的 refusal prefix 之后,生成仍可能转入有害分支。
    • 对齐:作者认为还应打断全程有害自回归一致性。做法是使用 worst-case harmful continuation states,初步实现为 random worst-insertion attack。
    • 作者结论:自回归一致性应同时作为安全对齐和攻击设计中的关键考虑。
阅读原文arxiv.org