论文提出随机插入攻击,利用自回归一致性绕过 LLM 安全对齐
When Autoregressive Consistency Hurts Safety Alignment
作者认为自回归一致性使安全对齐更新集中在早期token,短有害片段即可拐偏拒绝轨迹。
- 安全对齐要让模型拒绝有害查询,但微调常只改前几个输出token,拒绝前缀之后仍可能脆弱。作者认为这与自回归一致性有关。
- 分析学习动态,称自回归一致性把对齐更新集中到早期token。攻击例random insertion attack在拒绝轨迹插入短有害片段。对齐则用最坏有害延续状态,初步实现叫random worst-insertion attack。
- 作者称自回归一致性会使对齐更新集中在早期token。作者还称,短有害片段接在很长的拒绝前缀之后,仍可能把生成导向有害。
- 摘要没有把某项写成局限。作者把对齐实现称为初步的random worst-insertion attack,并认为对齐还应打断全程有害自回归一致性。
论文《When Autoregressive Consistency Hurts Safety Alignment》提出,大语言模型的安全对齐之所以脆弱,部分原因在于它往往很浅层:微调主要改变模型在最初几个输出 token 附近的行为。作者用自回归一致性解释这一现象,即下一 token 预测倾向于保持并延续当前回复轨迹,学习动态分析显示对齐更新会集中在早期 token 上。同一机制还预测出一类更广泛的攻击,即在输出轨迹任意位置诱导出有害延续状态。作为具体例子,作者提出随机插入攻击,在原本安全的拒答轨迹中插入一小段有害内容,借助自回归一致性维持有害分支,从而绕过安全对齐;即便在很长的拒答前缀之后,一小段有害内容也能把生成引向有害方向。作者据此提出对抗式安全对齐框架,并实例化为随机最坏插入训练,主张安全对齐应打破整条输出轨迹上的有害自回归一致性。
深度解读
这篇论文试图解决什么问题?
浅层安全对齐主要改前几个token,作者认为来自自回归一致性。
安全微调主要只改前几个输出 token,对齐因此停在浅层。
- 场景:安全对齐要让 LLM 拒绝有害查询下的有害内容。作者称通常靠 SFT [25]、DPO [19] 和 RLHF [3, 15];对齐模型在 prefill attack [1] 与 optimization based attacks [6, 14, 31, 32] 下仍脆弱。
- 已有描述:引言称 Qi et al. [17] 将此与 shallow safety alignment 相连:安全微调主要改靠近前几个输出 token 的生成分布。回复若以常规 refusal prefix 开头,对齐模型可能仍安全。
- 核心观察:作者认为可用 autoregressive consistency 理解,即 next-token prediction 会一致地保持并延伸当前轨迹(示意图 Def. 2.1 写当前分支)。作者称学习动态分析显示,对齐更新会因此集中到早期 token。
- 本文做法:作者称这指向可在输出轨迹任意位置诱发有害续写的攻击,例子是 random insertion attack。作者认为对齐还应打断全程有害自回归一致性,并提出使用 worst-case harmful continuation states 的框架,初步实现为 random worst-insertion attack。
- 威胁模型:
- 目标:绕过安全对齐,让生成维持有害分支。
- 能力:向原本安全的 refusal 轨迹插入短 harmful span。
- 受害系统:已对齐 LLM。作者称很长的 refusal prefix 之后,短 harmful span 仍可能把生成导向有害。
有哪些相关研究?
引言只涉及SFT、DPO、RLHF、prefill攻击和Qi等人的浅层对齐。
引言里点到的工作分三组。
安全对齐方法
- SFT 与偏好优化:作者称安全对齐通常由 SFT [25],以及 DPO [19]、RLHF [3, 15] 实现,目标是面对有害查询时拒绝生成有害内容。
对齐后仍脆弱的攻击
- prefill attack 与优化类攻击:作者称对齐后的 LLM 在 prefill attack [1] 和 optimization based attacks [6, 14, 31, 32] 下仍然脆弱。引言只把它们列为对齐仍会失效的例子。
浅层安全对齐
- Qi et al. [17]:作者称上述脆弱与 shallow safety alignment 密切相关,即安全微调主要修改靠近前几个输出 token 的生成分布。
作者把本文放在这条线上:用 autoregressive consistency 理解更新为何集中在早期 token,并讨论任意位置的有害续写,以及应打断全程有害一致性的对齐。
论文如何解决这个问题?
作者分析学习动态,称更新会集中到早期token。
作者用 autoregressive consistency 理解浅层安全对齐,并以 random insertion attack 说明有害续写可出现在拒绝轨迹中途,再提出基于 worst-case harmful continuation states 的对抗对齐。
概念
- 浅层对齐:作者称安全微调主要重塑前几个输出 token 附近的行为。引言转述 Qi et al. [17]:生成分布的改动也主要在这几个 token 附近。
- 自回归一致性:next-token prediction 倾向于一致地保持并延伸当前回复轨迹。示意图把 Def. 2.1 写成保持并延伸当前分支。
- 轨迹上的 token:示意图文字区分 prompt tokens、refusal tokens 与 harmful tokens,并标有 continuation。
学习动态
- 作者称分析了安全对齐的学习动态。
- 作者称自回归一致性可使对齐更新集中在早期 token,并称这为浅层安全对齐提供机制性解释。
- 示意图文字写:梯度更新集中在早期 token,在更后的 token 上较小;可见标注还有 gradient、consistency-driven、concentration。
随机插入攻击
- 在原本安全的 refusal 轨迹里插入一段短 harmful span。
- 作者称自回归一致性会维持由此分出的有害分支,从而绕过安全对齐。
- 作者称该片段即使位于很长的 refusal prefix 之后,仍可能把生成导向有害。
- 作者把它视为更广一类的例子:在输出轨迹任意位置诱发有害续写。
对抗安全对齐
- 作者认为对齐还应打断输出轨迹全程的有害自回归一致性。
- 框架采用 worst-case harmful continuation states。
- 作者给出的初步实现称为 random worst-insertion attack。
论文做了哪些实验?
摘要称短有害片段可在长拒绝前缀后把生成导向有害。
摘要的结论是定性的:作者称短 harmful span 可在长 refusal prefix 之后把生成导向有害。
实验设置
- 摘要与第 1 节开头未列出被测模型、数据集、基线、指标、评审方式、样本量或重复次数。
主结果
摘要没有指标数字,下表只转述主张。
作者主张 文中条件 出处 对齐更新可集中在早期 token 安全对齐的学习动态 摘要 短 harmful span 可维持有害分支并绕过对齐 插入原本安全的 refusal 轨迹 摘要 长 refusal prefix 后仍可能导向有害生成 random insertion attack 摘要 - 作者称更新集中为 shallow safety alignment 提供机制性解释。
- 作者称很长的拒绝前缀也挡不住短 harmful span 把轨迹带向有害。
- 作者认为自回归一致性应进入对齐和攻击两方面的设计。
其他消融与分析
- 摘要未给出消融变量或参数数字。
有什么可以进一步探索的点?
作者把对齐实现称为初步的random worst-insertion attack。
作者指出的局限与后续方向
- 摘要和第 1 节开头没有明确写成局限或未来工作的句子。作者把对齐侧实现称为 practical initial implementation,即 random worst-insertion attack(摘要)。
实验覆盖范围
- 作者称分析了安全对齐的学习动态(摘要)。
- 作者给出 random insertion attack,称短 harmful span 可维持有害分支,包括长 refusal prefix 之后(摘要)。
- 作者提出采用 worst-case harmful continuation states 的对抗安全对齐,初步实现为 random worst-insertion attack(摘要)。
- 摘要没有写出被测模型、基准、指标数值、样本量或评审方式。
总结一下论文的主要内容
作者用自回归一致性串起浅层对齐、插入攻击和最坏延续对齐。
作者把浅层安全对齐和一类续写攻击都归到自回归一致性上。
- 问题:对齐常用 SFT、DPO 与 RLHF,但作者称微调主要改前几个输出 token。引言称这与 Qi et al. [17] 的 shallow safety alignment 一致;对齐模型在 prefill attack 和优化类攻击下仍脆弱。
- 机制:下一步预测会保持并延伸当前轨迹。作者称因此对齐更新集中到早期 token。示意图文字也写梯度在早期 token 集中、在后续 token 较小。
- 攻击:random insertion attack 把短 harmful span 插入安全的 refusal 轨迹。作者称很长的 refusal prefix 之后,生成仍可能转入有害分支。
- 对齐:作者认为还应打断全程有害自回归一致性。做法是使用 worst-case harmful continuation states,初步实现为 random worst-insertion attack。
- 作者结论:自回归一致性应同时作为安全对齐和攻击设计中的关键考虑。