研究:安全对齐 LLM 如何从混合合规示范中学习
What Do Safety-Aligned LLMs Learn From Mixed Compliance Demonstrations?
四个对齐模型上,良性合规演示对有害合规或稀释、或无效应、或轻微放大。
- 对齐模型对上下文中的合规演示很敏感,但尚不清楚它们提取的是通用服从信号,还是演示请求是否有害。作者用良性与有害合规演示的混合来区分这两种可能。
- 作者控制良性演示数Nb和有害演示数Nh,用卡方与逻辑回归检验三个计数假设,并比较OLMo的SFT、DPO和Instruct检查点,另测五种顺序及格式采纳是否独立于合规。
- 四个模型均在部分N上拒绝总量假设。Table 2中Llama与Gemma β2为负,OLMo-Instruct不拒绝有害计数假设,GPT-OSS-20B的β2为+0.0319。SFT检查点β2为+0.0919,DPO后不能拒绝有害计数假设。
- 作者称阶段分析只做了OLMo,因多数提供者不发布中间检查点。后续方向包括更多模型族、基座模型和其他安全算法,以及用可解释性解释稀释与放大。论文未报告WildGuard与人工一致性。
- 被测模型
- Llama-3.1-8B-InstructOLMo-3.1-32B-InstructGPT-OSS-20BGemma-4-31B-ITOLMo-3.1-32B-SFTOLMo-3.1-32B-DPO
- 基准
- HarmBenchSORRY-BenchWildGuard-testRedTeam-2KUltraChatOR-Bench
- 指标
- compliance rateχ² p-valueβ2format adoption rate
论文研究在上下文中混合良性合规示范(无害请求加有帮助的回复)与有害合规示范(有害请求加有帮助的回复)时,模型如何解读不同类型的合规示范。在四个模型上,作者发现良性与有害示范不可互换:良性示范可能降低也可能提高有害合规,取决于具体模型。研究进一步指出,偏好优化是阻止良性示范提升有害合规的关键训练阶段,示范顺序表现出明显的近因偏差,且模型在拒答与上下文学习的关系上存在差异,有的在拒答时仍采用示范的格式,有的则在拒答时覆盖所有上下文信号。作者称,这项工作从证明基于示范的越狱有效,推进到刻画其运作机制:模型从合规示范中提取什么,取决于示范内容、顺序和训练方法。
深度解读
这篇论文试图解决什么问题?
混合合规演示里,模型学到的不是可互换的服从信号。
安全对齐模型从混合合规演示里学到的,是通用“助手会服从”规则,还是所演示请求是否有害。
- 场景:作者称对齐模型仍对上下文证据高度敏感。many-shot jailbreak 已显示大量有害问答演示可提高有害合规,但模型从合规上下文中提取什么,此前没有说清。
- 现有不足:作者称已有演示越狱主要用全有害演示;机制性 ICL 与激活 steering 通常研究通用任务、人格诱导或直接改内部状态,没有分离良性合规演示与有害合规演示如何交互。
- 核心对照:两类演示都呈现“助手服从”,但请求内容不同。若模型只响应通用合规信号,二者都应提高有害查询上的合规率;若模型追踪请求语义,则有害合规演示更关键,良性演示可能无关,甚至反向。
- 本文做法:作者用可控制的混合演示做假设检验,比较总量假设、有害计数假设和联合计数假设,并考察顺序,以及格式采纳是否与合规分离。
- 实验控制:演示放在当前有害查询之前的对话轮次中,不改权重。评测查询与演示池分开。回复由 WildGuard 判为合规或拒答。
有哪些相关研究?
相关工作分演示越狱、演示信息、ICL机制与内部控制。
作者按四条线讨论相关工作,并把本文定位为用混合演示分析合规证据如何迁移,而不是改进攻击。
- 演示越狱:Anil 等(2024)显示,以数百条有害问答演示做条件化可以越狱对齐模型,效力随上下文变长而可预测地上升。Zheng 等(2024)加强少样本演示越狱;Ma 等(2025)的 PANDAS 用肯定表述、负向演示和自适应采样改进 many-shot 攻击。作者称本文主要不是攻击改进,而是用混合 many-shot 上下文作分析工具。
- 演示传达什么:Min 等(2022)认为真实标签往往不如标签空间、输入分布和提示格式重要。Yoo 等(2022)显示正确标签是否重要取决于规模和提示设计;Wu 等(2023)显示示例选择与排序会强烈影响 ICL。作者称这关系到前缀与顺序消融:若演示主要教格式,安全与有害合规示例应比传递具体语义时更可互换。
- 上下文如何改变行为:Xie 等(2022)把 ICL 解释为对潜在概念的隐式贝叶斯推断;Hendel 等(2023)认为 ICL 常把演示压成与查询无关的任务向量。Choi 与 Li(2024)的 PICLe 用上下文示例引导高层人格;Bigelow 等(2025)提出上下文示例累积潜在概念证据,激活 steering 则移动先验。作者称本文检验两类演示是沿单一“服从”维度累积,还是对应更具体的潜在信念。
- 有害模仿与内部控制:Halawi 等(2024)显示虚假或有害演示的影响出现在前向后期,并与复制误导上下文的 false induction heads 有关。Turner 等(2024)用激活加法做推理时 steering;Arditi 等(2024)显示拒答由低维方向中介,去掉该方向会抑制安全拒答。作者指出这些工作直接改内部,本文干预只在上下文。
基线与数据:本文没有把已有攻击算法当作对照方法。参照是零演示合规率(Table 4)。有害演示来自 RedTeam-2K;主文良性演示来自 UltraChat;评测池来自 HarmBench、SORRY-Bench 和 WildGuard-test 的有害子集。
作者称,就他们所知,此前工作没有分离良性合规演示如何与有害合规演示交互。本文只改变演示的语义混合,看模型是把二者当可互换证据、只看有害示例,还是以更复杂的方式组合。
论文如何解决这个问题?
控制Nb与Nh检验三个计数假设,并分开测顺序与格式。
作者把混合合规演示做成假设检验:分开控制良性演示数 Nb 与有害演示数 Nh,看哪一种上下文摘要能预测随后有害查询上的合规率。
符号与三个假设
- 符号:N = Nb + Nh;N>0 时 ϕ = Nh/N。结果是有害评测查询上的合规概率。
- Htotal:上下文教的是与请求内容无关的“助手会服从”,Pb,h = f(Nb + Nh)。固定 N 时,合规率应大致不随 ϕ 变化。
- Hharm:模型默认已服从良性请求,只有有害合规演示提供新的反证,Pb,h = f(Nh)。固定 Nh 时,增加良性演示应无统计上可检出的效应。
- Hjoint:Pb,h = f(Nb, Nh)。放大指良性演示提高有害合规;稀释指良性演示降低有害合规。作者认为放大表示良性演示启动合作倾向,稀释表示它把行为推向与有害合规相反的方向。
检验按级联进行:先以 Htotal 为零假设;拒绝后再以 Hharm 为零假设、Hjoint 为备择。
数据与上下文
- 模型:Llama-3.1-8B-Instruct、OLMo-3.1-32B-Instruct、GPT-OSS-20B、Gemma-4-31B-IT。训练阶段另用 OLMo-3.1-32B-SFT、OLMo-3.1-32B-DPO,以及在 DPO 之上做 RL-VR 的 Instruct 检查点。作者称 DPO 加在 SFT 上,RL-VR 加在 DPO 上。
- 演示池:有害请求来自 RedTeam-2K,经 GPT-OSS-120B 过滤后为 1,492 条。主文良性请求用 UltraFeedback 中的 UltraChat;附录另用 OR-Bench,以及 GPT-OSS-120B 对 RedTeam-2K 的良性改写。服从式回复由 abliterated GPT-OSS-20B 生成。附录 A 给出改写用的完整提示词。
- 评测池:1,404 条有害查询,来自 HarmBench、SORRY-Bench 和 WildGuard-test 的有害子集,与演示池分开。每条配 2 次随机抽样,共 2,808 个评测点。
- 拼接:演示是更早的用户–助手轮次,评测查询是当前用户轮次。默认先放全部良性演示,再放全部有害演示。每条演示在拼装前截到 2000 字符;安全改写池截到 1500 字符。
统计检验
固定 N∈{4, 8, 16, 32, 64, 128},取 ϕ∈{0, 0.25, 0.5, 0.75, 1},对五个 ϕ 组做 χ² 检验,df=4。p 低于 Bonferroni 阈值 α=0.05/6=0.0083 则拒绝 Htotal。
拒绝后固定 Nh∈{8, 16, 32} 并变化 Nb,用正文式 (1) 区分 Hharm 与 Hjoint:
logit Pb,h=β0+β1log(Nh+1)+β2log(Nb+1)
β2 接近 0 支持 Hharm;β2>0 为放大,β2<0 为稀释。Wald 检验的 α=0.05。作者称按 Nh 组合并后样本量为 42k,此时 Wald 检验实际上等价于似然比检验。合规概率写为
Pb,h=P(comply∣ Nb=b,Nh=h)
顺序、格式与判定
- 五种顺序:Prefix 先有害后良性;Suffix 先良性后有害;Random 均匀随机;Middle 把有害演示夹在两半良性演示之间;Interleave 轮流放置,一类用尽后把剩余附在末尾。正文写在 Nh=64 上变化 ϕ;Figure 5 图注是 32 条良性加 32 条有害,附录 B.3 写 N=64。
- 两种行为:格式采纳指回复是否抄演示回复开头的前缀;合规指是否给出有害内容。中性前缀与合规信号前缀分别加在全部演示回复开头。合规率在无前缀条件下测量。Figure 6 的设置为 N=64、ϕ=0.5,报告相对零演示基线的增量。
- 生成与判定:T=0.7,最长 1000 token;每个条件对全集跑两遍。WildGuard 用强制前缀条件化“请求已知有害”,再比较下一 token 上拒答与非拒答的 log-odds;为正判拒答。合规率定义为 1 减拒答数除以总查询数。
论文做了哪些实验?
四模型均拒绝总量假设;良性演示或稀释、无效应或轻微放大。
实验设置
- 被测模型:Llama-3.1-8B-Instruct、OLMo-3.1-32B-Instruct、GPT-OSS-20B、Gemma-4-31B-IT;另测 OLMo-3.1-32B-SFT 与 OLMo-3.1-32B-DPO。
- 数据:评测池 1,404 条,来自 HarmBench、SORRY-Bench、WildGuard-test 有害子集。有害演示 1,492 条。主文良性池为 UltraChat;附录 B.2 为 OR-Bench 与 RedTeam-2K 良性改写。
- 对照:零演示合规率(Table 4)。先以 Htotal 为零假设,拒绝后再检验 Hharm。没有把其他攻击算法列为基线。
- 指标:合规率 = 1 − 拒答数/总查询数。Htotal 用 χ²(df=4,α=0.0083)。Hharm 对 Hjoint 用正文式 (1) 的 β2,Wald 检验 α=0.05。格式实验另报格式采纳率。
- 评审:WildGuard;log p(yes)−log p(no) 为正判拒答。论文未报告人工复核。
- 重复与生成:每条查询 2 次随机演示抽样,共 2,808 点;附录 A 称每个条件对全集跑两遍。T=0.7,最长 1000 token。作者称回归聚合后样本量为 42k。
主结果
据 Table 2,在 Figure 3 的设置(Nh∈{8, 16, 32},变化 Nb)上拟合式 (1)。表中 Llama-3.1-8B、OLMo-3.1-32B 对应主实验的 Instruct 模型。
表格较宽,可左右滑动
模型 β2 p 判定 GPT-OSS-20B +0.0319 1.1e-02 Amplification Llama-3.1-8B −0.1782 6.9e-123 Dilution OLMo-3.1-32B −0.0118 1.1e-01 Not rejected Gemma-4-31B-IT −0.2010 6.7e-175 Dilution - Htotal:作者称 Llama、OLMo、Gemma 在全部测试的 N 上拒绝 Htotal;Table 1 中三者的 p 均低于 0.0083。GPT-OSS-20B 在 N=8、32、64、128 上低于阈值(p 为 5.4e-04、8.7e-04、6.3e-06、6.6e-34),N=4 为 4.1e-01、N=16 为 3.5e-02,未低于阈值。正文只点名 N∈{32, 64, 128};N=8 的拒绝来自 Table 1。
- 方向:作者称 Figure 2 中前三个模型的合规率随 ϕ 上升,GPT-OSS-20B 全程较低;图注称其对 many-shot 演示稳健。Figure 3 中 Llama 与 Gemma 随 Nb 下降,OLMo 与 GPT-OSS 相对平稳。作者认为稀释说明 UltraChat 演示虽多与安全话题无关,仍强化 helpful-and-harmless 人格。
- 放大的解释:对 GPT-OSS 的正 β2,作者猜测其安全训练针对纯有害 many-shot,未必覆盖混合上下文,且称效应量级小。这是作者的猜测,不是检验结果。
训练阶段
- 测了什么:对 OLMo 的 SFT、DPO、Instruct 检查点重复变化 Nb。Figure 4 固定 Nh=32。Table 3 聚合 Nh∈{8, 16, 32}。
- 结果:SFT 的 β2=+0.0919,p=1.3e-39,Amplification。DPO 的 β2=−0.0114,p=1.3e-01,Not rejected。Instruct 的 β2=−0.0118,p=1.1e-01,Not rejected。作者称 Figure 4 中 SFT 的合规率随 Nb 上升,DPO 与 Instruct 平稳,RL-VR 进一步降低总体合规率。
- 作者的解读:贡献列表称 DPO 完全消除该效应;Table 3 的结果是不能拒绝 Hharm。作者认为这些行为与“SFT 的安全回复和一般合作性缠在一起”相一致,DPO 与 RL-VR 不再表现出这种外溢。作者称这是否是表征解耦,仍是开放问题。
演示顺序
- 测了什么:五种排列。Figure 5 图注为各 32 条。正文写 Nh=64;附录 B.3 写 N=64,ϕ=0.5 对应各 32 条。下列百分点按图注与附录。
- 结果:除 GPT-OSS-20B 外,作者称 suffix 最高,其后为 interleave 与 random,再是 prefix 与 middle。作者称 Gemma 的 suffix 与 prefix 相差 35%,Llama 约 19%,OLMo 约 13%。附录 B.3:ϕ=0.25 时 Gemma 的 suffix 为 51.1%,其他顺序为 22–32%,差 29 个百分点;ϕ=0.75 时 interleave 为 72.5%,高于 suffix 的 68.3%。GPT-OSS 各顺序相差在 1–2 个百分点内。
- 作者的解读:作者认为这是近因偏差,关键是评测查询附近没有有害演示。ϕ=0.25 时 Llama 的 prefix 为 19.7%,高于 random 的 15.8% 和 interleave 的 16.7%;作者认为有害演示稀少时,交错可能被周围良性示例冲淡。
格式采纳与合规
- 测了什么:演示回复以中性前缀或合规信号前缀开头。Figure 6 为 N=64、ϕ=0.5 时相对零演示、无前缀基线的增量。Figure 7 按最终回复是否合规分开统计格式采纳。
- 结果:正文给出,Llama-3.1-8B 拒答回复中采纳中性前缀的比例为 86.9%,采纳合规前缀为 51.5%。Gemma-4-31B 合规回复中采纳合规前缀为 52.1%,拒答中为 0.1%。作者称 Llama 与 OLMo 更容易采纳格式,Gemma 更容易采纳合规;GPT-OSS-20B 通常不采纳格式,因为有害查询上会输出标准拒答提示。
- 作者的解读:作者认为 Gemma 一旦决定拒答就丢掉演示格式;Llama 把合规与格式分开。OLMo 定性上类似 Llama,但总体格式采纳更低。附录 B.4 称 Gemma 拒答中的格式采纳在全部测试 ϕ 上为 0.0–0.1%。
其他消融与分析
- 附录 B.2 称 OR-Bench 与 RedTeam-2K 安全改写的 ϕ 趋势与 UltraChat 一致。Table 5b 中 GPT-OSS 在安全改写的全部 N 上不能拒绝 Htotal;Table 5c 中 OR-Bench 仅 N=64(p=5.1e-03)与 N=128(p=9.1e-27)低于 0.0083。
- 零演示基线(Table 4):GPT-OSS-20B 10.3%,OLMo-3.1-32B 15.7%,Gemma-4-31B 22.4%,Llama-3.1-8B 33.8%。
- 合规前缀相对无前缀(附录 B.4,Figure 12):Llama 与 OLMo 在各 ϕ 上高 9–16 个百分点;Gemma 低 19–23 个百分点。作者称 Gemma 的方向出乎意料。
- Llama 在 ϕ=0.25 时,合规相对零演示基线的增量为 −10.5%,中性格式采纳仍为 86–92%;ϕ=0.5 与 0.75 的合规增量为 +7.0% 与 +17.0%(附录 B.4)。
- Gemma 的合规增量在各 ϕ 为 +33.6% 至 +41.9%,中性格式采纳 0.3–2.9%,合规前缀格式采纳 13.8–25.9%(附录 B.4)。
- OLMo 合规回复中合规前缀采纳率随 ϕ 从 54% 到 70%,拒答回复中为 15–18%(附录 B.4)。
有什么可以进一步探索的点?
作者提出扩展模型族与安全算法,并用机制方法解释稀释和放大。
作者指出的局限与后续方向
- 模型族与规模:作者称扩展到更多模型族和规模,才能分清哪些发现普遍、哪些特定于某些架构或训练配方(第5节)。
- 阶段分析集中在 OLMo:作者称原因是多数模型提供者不发布中间训练检查点(第5节)。
- 基座模型与其他算法:作者把扩展到基座模型,以及 refusal-SFT 或 RLHF 等安全训练算法,列为后续方向(第5节)。
- 从行为到因果:作者称可用可解释性方法找出负责稀释与放大的内部电路,从行为刻画走到因果解释(第5节)。
- 防御用途:作者称稀释效应留下一个后续问题:良性合规演示能否用作防御,使模型对有害演示上下文更稳健(第5节)。
实验覆盖范围
- 主结果模型为 Llama-3.1-8B-Instruct、OLMo-3.1-32B-Instruct、GPT-OSS-20B、Gemma-4-31B-IT;训练阶段比较包含 OLMo-3.1-32B-SFT、OLMo-3.1-32B-DPO 和 Instruct(第3.2节、第4.3节)。
- 有害评测查询 1,404 条,来自 HarmBench、SORRY-Bench 与 WildGuard-test 有害子集,与演示池分开;每条 2 次随机抽样,共 2,808 个评测点(第3.2节)。
- 有害合规演示 1,492 条;主文良性池为 UltraChat,附录 B.2 另报 OR-Bench 与 RedTeam-2K 安全改写。服从式回复由 abliterated GPT-OSS-20B 生成,过滤与改写使用 GPT-OSS-120B(第3.2节、附录 A)。
- 报告了固定 N 的 χ²、变化 Nb 的逻辑回归、五种顺序,以及两种前缀下的格式采纳;生成设置为 T=0.7、最长 1000 token,每个条件两遍(第4节、附录 A、附录 B)。
- 论文未报告 WildGuard 的 log-odds 判定与人工标注的一致性,也未报告 1,404 条在三个基准中的分项数量。
总结一下论文的主要内容
良性与有害合规演示不可互换,效应取决于模型、顺序和偏好优化。
这项工作问的是:安全对齐模型从混合的良性与有害合规演示中提取的,是通用服从规则,还是请求是否有害。作者控制 Nb、Nh、ϕ 和顺序,检验总量、有害计数与联合计数三个假设,而不是提出新的攻击算法。
- 两类演示不等价:在 UltraChat 良性池上,四个模型都至少在部分 N 拒绝 Htotal。Table 1 中 Llama、OLMo、Gemma 的全部被测 N 都低于 0.0083;GPT-OSS-20B 在 N=4(p=4.1e-01)与 N=16(p=3.5e-02)未低于阈值。
- 良性演示的作用依模型而变:Table 2 中 Llama-3.1-8B 的 β2 为 −0.1782,Gemma-4-31B-IT 为 −0.2010,作者判为稀释;OLMo-3.1-32B 为 −0.0118,p=1.1e-01,不能拒绝 Hharm;GPT-OSS-20B 为 +0.0319,作者判为轻微放大。
- 训练阶段:OLMo 的 SFT 检查点 β2 为 +0.0919。贡献列表称 DPO 完全消除该效应;Table 3 中 DPO 与 Instruct 都不能拒绝 Hharm。作者称偏好优化与“良性演示不再抬高有害合规”这一转变同时出现。
- 顺序与格式:作者称易受影响的模型有近因偏差,suffix 高于 prefix。Llama 拒答时仍采纳中性前缀(86.9%);Gemma 拒答时合规前缀采纳率为 0.1%,合规时为 52.1%。
- 作者的结论:模型从合规演示中提取什么,取决于演示内容、排列和训练方法;合规采纳与格式采纳由不同机制支配。作者认为混合演示可以区分稳健的安全边界和会被合作性推移的模型,并查看哪个训练阶段改变了这一行为。