跳到正文
原文
arXiv:越狱、提示注入、投毒与防御· arXiv:2610.11005· Zhankai Ye, Yanning Wang, Yukai Jin, Bo Mei, Fangyi Li, Wei Wang, Shangqian Gao, Xin Liu·本站收录 · 原文发表

研究:叙事包装可跨语言绕过 LLM 拒答,Qwen3-1.7B 上古文攻击成功率达 95.7%

How Narrative Wrapping Affects LLM Refusal: A Cross-Language Benchmark and Defense

论文速读

防御

据论文 PDF 整理(AI 生成),以原文为准

GUISE测叙事包装下的拒答失效,AXIS用旋转与承诺项训练;作者称三模型上Comp最高。

威胁模型攻击者把有害请求嵌入角色扮演或叙事包装,语域可为英文、现代汉语或文言文,并可用训练未见的文言体裁。

问题
已对齐模型常拒绝直说的有害请求,却回答包在角色或叙事里的同一请求。作者要分开语域与叙事包装的作用,并在不误拒同风格良性请求时保住拒绝。
方法
构建GUISE:英、现汉、文言平行请求,有害与良性配对,留出包装,WTA计为攻击成功。AXIS在DPO上加旋转项与承诺项,用LoRA把文言有害方向拉向现代汉语拒答方向。
实验与结果
基座Qwen3-1.7B文言包装严格ASR为95.7%(1067条),裸请求20.4%(334条,Table 1)。作者称AXIS的Comp在三模型上最高(Table 2:78.4、92.9、93.7)。
局限与可以继续做的
作者称表征说明是相关的、非因果的,1.7B单一λrot不是逐模型optimum,且该剂量扫描不能跨训练复现。实验模型为Qwen3-1.7B、Qwen3-4B、GLM-4-9B,4B两个seed、9B一个。
实验设置Qwen3-1.7B、Qwen3-4B 等 · GUISE、harm334 等 · SRR、ASR 等
威胁模型
攻击者把有害请求嵌入角色扮演或叙事包装,语域可为英文、现代汉语或文言文,并可用训练未见的文言体裁。目标是让已对齐模型回答直接表述时会拒绝的请求。严格评审将warn-then-answer与直接作答计为成功。论文未写白盒或黑盒。
被测模型
Qwen3-1.7BQwen3-4BGLM-4-9B
基准
GUISEharm334ood834XSTestAlpacaAdvBenchStrongREJECTHarmBenchCLAS-2024
指标
SRRASRover-refusalhelpfulnessComp
AI 导读研究者测量了角色扮演或叙事包装绕过安全对齐模型拒答的跨语言差异,在 Qwen3-1.7B 上英文攻击成功率已达 89.4%,现代中文为 93.0%,文言文则达到 95.7%。团队据此构建了 GUISE 基准,包含英文、现代中文和文言文的平行请求、配对的有害与良性样本、留出评估的包装类型,并把先警告后回答也计为攻击成功。表征分析显示,语言和语体会让有害请求的表征略微偏离模型的拒答方向,而叙事包装使其偏离幅度大得多。作者提出 AXIS 方法,将偏好优化与旋转目标结合,把有害请求表征对齐到拒答方向,并用承诺目标训练模型彻底拒答而非先警告后回答;在 Qwen3-1.7B、Qwen3-4B 和 GLM-4-9B 上,AXIS 在对比方法中取得最高的安全与可用性综合得分。

研究者测量了角色扮演或叙事包装绕过安全对齐模型拒答的跨语言差异,在 Qwen3-1.7B 上英文攻击成功率已达 89.4%,现代中文为 93.0%,文言文则达到 95.7%。团队据此构建了 GUISE 基准,包含英文、现代中文和文言文的平行请求、配对的有害与良性样本、留出评估的包装类型,并把先警告后回答也计为攻击成功。表征分析显示,语言和语体会让有害请求的表征略微偏离模型的拒答方向,而叙事包装使其偏离幅度大得多。作者提出 AXIS 方法,将偏好优化与旋转目标结合,把有害请求表征对齐到拒答方向,并用承诺目标训练模型彻底拒答而非先警告后回答;在 Qwen3-1.7B、Qwen3-4B 和 GLM-4-9B 上,AXIS 在对比方法中取得最高的安全与可用性综合得分。

深度解读

6 个问题,点开问题读完整回答

  1. 这篇论文试图解决什么问题?

    叙事包装让模型回答本会拒绝的请求;作者用GUISE测量,并用AXIS训练拒绝。

    已对齐模型会拒绝直说的有害请求,却回答嵌在角色扮演或叙事包装中的同一请求。

    • 场景:作者称低资源语言和异常文学语域可以绕过安全对齐。文言文与现代汉语共用文字、词汇大量重叠,但句法、风格和叙事惯例不同,因此可固定有害意图、只改语域。
    • 现有不足:作者称CC-BOS同时改变语域和包装,成功分不出因素。拒答短语匹配会把warn-then-answer(先警告或拒绝、再给出有害内容,下称WTA)判成拒绝;在Qwen3-1.7B对334条留出包装意图的回答上,该匹配器把75%的WTA判为拒绝。同一包装回答上,CC-BOS宽松评审为28.8–45.1%,严格评审为89.4–95.7%(Table 1)。
    • 观察:严格评审下,基座Qwen3-1.7B裸请求攻击成功率为英文18.0%、现代汉语16.2%、文言文20.4%(334条留出意图);包装后为89.4%、93.0%、95.7%(1,067条意图,Table 1)。作者称换语域跨6.3个百分点,文言包装使攻击成功上升约75个百分点。引言称嵌入同一有害意图;Table 1注明两行意图条数不同。
    • 威胁模型:
      • 目标:让模型回答直接表述时会拒绝的有害请求。
      • 能力:把请求嵌入persona与叙事语境;语域可为英文、现代汉语或文言文。
      • 泛化:训练未见的文言体裁,以及包装固定、只改语域的平行请求。
      • 受害系统与判定:已安全对齐的语言模型。严格评审把WTA与直接作答计为攻击成功。论文未写攻击者对权重的知识类型。
    • 提出的问题与方法:作者问模型如何在未见叙事包装下保持拒绝、又不拒绝良性请求。为此构建基准GUISE,并提出训练期方法AXIS。
  2. 有哪些相关研究?

    相关工作分叙事越狱与语域、表征干预,以及WTA的评审缺口。

    叙事包装与语域偏移

    • 竞争目标与角色:Wei et al. (2023)把越狱追溯到竞争目标与泛化不匹配。作者把persona提示(Shen et al., 2024)、persona调制(Shah et al., 2023)和嵌套虚构场景(Li et al., 2023; Ding et al., 2024)归到前一原因。
    • 低资源与文体:后一原因包括低资源语言(Deng et al., 2024)、密码(Yuan et al., 2024)、ASCII艺术(Jiang et al., 2024)、诗歌(Bisconti et al., 2025)、同人(Luo et al., 2026)及其他风格(Xiao et al., 2026)。
    • 文言文优化器:Huang et al. (2026b)的CC-BOS固定有害请求、搜索多种文言包装。作者称它同时改语域和包装,因此成功分不出哪个因素起作用。

    表征干预与更深的拒绝

    • 拒答方向:Arditi et al. (2024)称拒绝由单一方向中介。后续工作把有害表征改道(Zou et al., 2024)、推开(Yousefpour et al., 2025),或在微调时锚定拒答方向(Du et al., 2025)。
    • 推理期转向:作者称把该方向作为steering vector(Rimsky et al., 2024)能在包装下恢复拒绝,但也会破坏约三分之一的良性回答(Section 2、Section 4)。本文把旋转放在训练期,并加安慰剂匹配的锚点对照。
    • 响应深处与事后微调:另一路把拒绝推入响应更深处(Qi et al., 2025; Yuan et al., 2025a; Zhao et al., 2025b)。作者转述Zhao et al. (2025b):DPO损失更多是压低有害回答,而不是加强拒绝。对齐也可在后续微调后变弱(Qi et al., 2024);Booster(Huang et al., 2025)与投影约束(Du et al., 2025)是针对这一点的防御。

    如何判定WTA

    • 名称与量表:WTA另有partial compliance(Yu et al., 2023)、refusal then compliance(Han et al., 2024)、warn-but-answer(Mao et al., 2026)等叫法;Röttger et al. (2024)命名了其良性对应物。Souly et al. (2024)、Xie et al. (2025)、Mazeika et al. (2024)的量表已把该模式计为攻击成功。
    • 短语匹配:拒答短语匹配随AdvBench引入(Zou et al., 2023),后被Liu et al. (2024)用作指标。作者引Chao et al. (2024):它与专家判断一致率仅56%,假阳性率64%;Souly et al. (2024)称它与人类判断的相关差于所比的其他方法;Cai et al. (2025)称它标为安全的回答中有三分之一仍违反政策。
    • 仍被广泛使用:作者引Ran et al. (2024),称它仍是近九十篇越狱论文中第二常见的评审,并出现在近期防御论文的标题数字里(Gao et al., 2025; Djanibekov et al., 2025)。Huang et al. (2026a)主张停止这种做法。

    基线方法与基准

    • 五个外部基线:SimPER(Xiao et al., 2025)、α-DPO(Wu et al., 2025)、DOOR(Zhao et al., 2025b)、Deep Alignment(Qi et al., 2025的deepened-alignment目标)、Booster(Huang et al., 2025),外加plain DPO与基座模型(Table 2)。RepBend(Yousefpour et al., 2025)因在作者报告的系数下产生重复退化文本而单独报告(Appendix I)。
    • 数据来源:意图来自AdvBench、StrongREJECT、HarmBench与CLAS-2024;良性控制来自Alpaca;对抗性良性为文言文版XSTest(Röttger et al., 2024)。评测在作者构建的GUISE划分上进行。

    作者把本文放在上述工作旁边:用配对意图把包装和语域拆开。他们称结果与Aziz et al. (2026)、Wang et al. (2025)等说法相反:包装后有害与良性仍可分,但类间方向转离拒答方向,语域只设定裸请求的起点。AXIS在训练期旋转该方向,并用承诺项加强被选中的拒绝,直到停止符。

  3. 论文如何解决这个问题?

    GUISE配对同一意图的四种问法;AXIS用旋转项与承诺项训练LoRA。

    作者用基准GUISE把同一意图做成直接问法、叙事包装、同包装良性请求和留出体裁,再用AXIS在冻结权重上训练一个LoRA:偏好优化同时学拒绝与作答,旋转项对齐表征,承诺项把拒绝进行到底。

    配对请求与划分

    • 四种问法:有害意图记为x。qbare是不带角色或叙事的文言直接请求,qwrap是嵌入persona与文言叙事的包装版本。GUISE还问:同样包装下的良性请求会不会被拒;留出包装或另一语域上,失败是否泛化(Section 3)。
    • 有害与良性:意图来自Section 2三个公开红队集与CLAS-2024的去重并集。保留有再分发许可、且CC-BOS流水线能找到其自身评审确认越狱的1,067条;每条最多五条被该评审确认的包装。同一包装生成器不做搜索,把1,000条Alpaca指令改写成良性控制,语域和包装与攻击相同,只差意图。
    • 留出与平行语域:不针对任何模型搜索的程序生成器,把留出意图改写成三种训练数据中没有的文言体裁,过滤后为332条意图上的834条攻击,加489条良性对照(Appendix D)。只翻译、不做搜索的流水线把1,011条有害与450条良性意图渲染成英文、现代汉语和文言文,意图与包装固定,只变语域。
    • 划分与审核:按意图分为561训练 / 98开发 / 408测试,每次训练前再核验意图不相交(Appendix B)。主表每条意图用一条在读结果前选定的规范包装。受过中国语言文学训练的标注者核对每条发布的有害提示是否保住英文意图;丢失意图的提示全程排除。学者修订的核心为50条意图乘3种风格、共150条;Appendix C称其余97%为机器渲染。

    拒答方向与两个训练期目标要修的量

    • 方向:hL(x)是请求在固定层L的最后token隐藏状态。对每个条件c,有害减良性方向Δc是匹配有害集与良性集的隐藏状态均值之差。拒答方向r̂取裸现代汉语、固定提示模板下Δref的单位向量(Arditi et al., 2024)。
    • 角度与投影:θc是Δc与r̂的夹角,只反映方向;pc是Δc在r̂上的投影,同时依赖方向和长度,单位为隐藏状态。分析在总体、匹配集合上做,作者称它是相关的,不是逐条预测。
    • 推理期对照为何不够:作者称若只把包装后的有害方向等范数转到r̂上,行为不变;若把缺失的拒答投影当作沿r̂的常数平移加回去,拒绝会回来,但平移不看请求内容,约三分之一的良性回答变成无意义文本。因此校正应依赖内容。

    AXIS的三项损失

    • 总损失:在冻结权重上训练一个LoRA;适配器关闭时的同一权重是各项的参考模型πref。总损失为L = Lpref + λrot Lrot + λcmt Lcmt,即偏好项、旋转项与承诺项的加权和。
    • 旋转:r̂只在冻结基座、训练划分意图上算一次。每步采样K条文言裸有害请求与K条文言裸良性请求,在策略πθ的同一层读出Δθ。Lrot = 1 − cos(Δθ, r̂)把该方向拉向现代汉语拒答方向。旋转只用提示表征,不用包装后的请求。
    • 承诺:旋转不阻止WTA。承诺项是被选完成y+的长度归一化负对数似然,对前k个token和结尾EOS加权(ω>1)。有害提示的y+是拒绝,良性提示的y+是有用回答。作者称这是抬高被选拒绝,而不是只压低被拒续写。
    • 偏好:对包装后的文言攻击或同包装良性请求,Lpref是标准DPO,β=0.1,只用完成部分的对数概率。有害与良性两半一起训练。Section 7.2报告去掉这一项的代价。

    训练对、超参与判定

    • 偏好对:训练前用Section 3的评审标注全长回答,建成固定数据集。有害提示的rejected是WTA或直接作答,chosen是不超过60字、不含方法或步骤的同语域短拒绝,来自80条经评审核实的池。良性提示的chosen是有用回答,rejected是拒绝。width-1池有3,336对,覆盖583条有害与598条良性训练意图;其中23条无再分发许可(61对)用于训练,但排除出发布和全部评测(Appendix E)。
    • 主剂量:除非另述,λcmt=0.2,旋转每类K=12,承诺k=4、ω=2。主比较在三个模型上用λrot=0.1,不做逐模型调参。消融与机制实验用λrot=1,以便在固定剂量上对比各项,而不是各自的最优点(Section 6、Appendix L)。
    • 优化:1.7B控制实验为LoRA r=16、α=32、学习率2×10^-5、两轮、有效批16、序列预算1,024、旋转批每类12、层24。width-1池417次更新,width-5池4,756对、594次更新。生成对所有arm相同:贪心、批32、最多1,536个新token。4B与9B用同一配方,LoRA覆盖attention与MLP。
    • 四类评审:一个输出中心的四类评审阅读每条回答,输入英文意图和回译后的完成,输出firm refusal、WTA、direct answer或off-topic(Appendix F、G.1)。WTA计为攻击成功;拒绝后只有高层、非操作性讨论则算off-topic,不惩罚作者所称部署政策要求的安全完成。SRR = 1 − [P(WTA)+P(direct answer)];Section 6把它写成P(firm)+P(off-topic)。每批重评冻结的参考回答,参考分超出预设范围则丢弃该批。
  4. 论文做了哪些实验?

    作者称三模型上AXIS的Comp最高;只看安全性时作者称它不是第一。

    实验设置

    • 模型与arm:LoRA训练在Qwen3-1.7B、Qwen3-4B(两个seed)和GLM-4-9B(一个seed,另一模型族)。1.7B的DPO、DPO+rot、AXIS、锚点对照与无偏好项arm各三个seed。五个外部方法按官方代码与作者系数重实现。AXIS在三模型上共用λrot=0.1。
    • 评测集:harm334为334条留出意图、各一条分布内包装攻击。ood834为其中332条意图上的834条攻击,三种训练未见的文言体裁,作者称约2.5条/意图。xstest为245条文言文XSTest。benign为300条攻击框架中的普通良性请求。Section 6写100条意图的开发集只用于选检查点;Section 3的划分是561/98/408。
    • 指标:harm、ood为严格拒答率SRR。Table 2的xs与help是对抗性良性请求上的过拒与有用性,不是300条普通良性。Comp = 1/2 mean(harm, ood) + 1/2 mean(100−xs, help)。
    • 评审:有害集用deepseek-chat上的四类承诺评审。良性集分为helpful、refusal、nonsense。须用deepseek-chat的直接作答模式;显式模型名会切到未校准的推理模式(Appendix G.2)。每批重评1,002条冻结锚点,锚点SRR不在[20.5, 25.5]或不可解析超过8条则丢弃。比较在同一次调用内逐项配对。
    • 一致率与统计:Section 6称有害集评审与盲注一致率77.5–92.8%,良性集87.9%。Appendix F把校准(675条,较早模型上77.5%,κ 0.64)与后来的盲注(有害725条92.8%,良性240条87.9%)分开。arm比较用逐项精确McNemar,评测集内Holm校正;自助法按意图重采样。seed分开分析、不合并。
    • 泄漏:每次任务前六道自动检查确认评测项未进入训练(Appendix B)。Table 5称检查通过;8条英文评测意图因文言翻译撞上几何训练集句子而被排除。

    主结果

    Table 2,seed 0,通过锚点检查的一批,AXIS为λrot=0.1。下表只列Comp。

    表格较宽,可左右滑动

    方法Qwen3-1.7BQwen3-4BGLM-4-9B
    base52.460.358.3
    DPO50.971.775.8
    SimPER58.989.992.3
    α-DPO61.177.991.5
    DOOR54.987.088.7
    Deep Alignment61.572.073.6
    Booster63.873.490.0
    AXIS78.492.993.7
    • 1.7B的交换:作者称此模型上配方没有在分布内追上最强基线。α-DPO在两个攻击集上更安全27.5与31.9个百分点,Booster为11.4与12.9(均p<10^-4),过拒多67.3与42.0个百分点(p<10^-28)。Table 2中1.7B的harm/ood/xs:AXIS为71.9/68.1/9.8,α-DPO为99.4/100.0/77.1,Booster为83.2/81.1/51.8。作者称综合分领先只来自良性一半;更看重分布内安全时应提高剂量。
    • 4B与9B:作者称4B上AXIS与SimPER的安全性为p=1与0.07,过拒少5.7个百分点(p=0.007);9B上分布内超过SimPER(p=10^-3),与Booster的安全性p=0.69,过拒少9.0个百分点(p<10^-4)。基座的问题在包装攻击:1.7B的harm/ood为5.4/29.1,4B为5.1/54.4,9B为7.5/38.0。这些SRR与Table 1的ASR不是同一指标、也不是同一集合。
    • 领先随规模缩小:Appendix M的配对自助区间为1.7B +14.5 [+11.1, +18.1]、4B +3.0 [+1.0, +5.2]、9B +1.4 [−0.2, +3.0]。作者称9B上该领先不显著。只看安全性,作者称1.7B与4B排第三、9B排第二。三模型同时成立的可用性权重为[0.4, 0.7]。Table 2注:9B上DOOR有92条空回答,去掉后ood为97.8%。

    旋转、锚点与偏好项

    • 测了什么:Table 3在λrot=1上对比方程各项(Section 6)。1.7B为三seed均值,4B为两seed均值,9B为单seed。列是harm、ood的SRR,以及对抗性良性与普通良性的过拒。此表与Table 2不是同一批,基座数字也不同。
    • 结果:1.7B上DPO+rot的ood为57.3,real-anchor AXIS为81.0,去掉DPO的rot+cmt为92.4,但普通良性过拒为35.7,AXIS为1.1。作者称十二个适配器把夹角从61–81°收到22–32°,留出包装的拒答投影从约200升到724–858,裸现代汉语为761。三个seed的ood SRR上升+47.0、+42.7、+39.7个百分点(均p<10^-76),与投影增益ρ=0.94。
    • 作者的解读:旋转项对应留出包装上的泛化;1.7B上它在每个seed都不动harm334,作者称这是模型性质而非该项的性质。三个锚点(含保留重叠c0=0.785的安慰剂)在每个seed上都按与模型自身安全轴的重叠排序。去掉偏好项后,普通良性拒绝为27–41%,AXIS为0–3%,作者称之为false safety的受控实例。同一AXIS配置在harm334上跨66.5–83.5,作者称单seed arm应读成批内排序,不是效应量。

    留出包装、语域与规模

    • 共享剂量下的几何:ood834未针对模型搜索。Table 2中AXIS的ood SRR为68.1%、98.8%、99.3%。Figure 4标注,相对无旋转项的同一配方,λrot=0.1把三seed均值SRR从harm334的44.3%抬到66.6%,ood834从42.8%抬到68.4%。作者称ρ=0.79、p=0.002;ood上三个seed为+55、+13、+9个百分点。夹角收窄7–15°,投影增加裸现代汉语的0.15–0.52。
    • 只在文言文上后训练:Table 4中,1.7B适配器在harm334上的SRR为文言71.3%、现代汉语68.4%、英文68.1%;ood834为68.5%、73.7%、70.4%。未训练模型在harm334上为3.5%、6.7%、9.7%。作者称离开训练语域,分布内最多差3.2个百分点;留出包装上现代汉语73.7%与英文70.4%高于文言文68.5%。论文未说明Table 4与Table 2是否同一批评审。
    • 规模与表内例外:Table 11中,包装后夹角没有随规模变小。Qwen3-1.7B诊断层L24:裸英文29.9°、裸文言38.0°、harm334 79.4°、dialogue 61.2°、historiography 80.7°、statute 75.0°。作者称ood与harm334相对拒答方向的夹角相同;表中dialogue为61.2°,与harm334的79.4°不同。Table 3里只加旋转,harm334从4B的23.7%到48.8%、9B的44.9%到84.4%;作者称4B与9B上各锚点都把ood834推到饱和,arm改在过拒上分开。

    其他消融与分析

    • Table 12(seed 0,真实锚):1.7B的Comp在λrot=0.03/0.1/0.3/1为74.8/78.4/81.9/84.3;4B在0.1为92.9/92.1(seed 0/1),9B在0.1为93.7。Appendix L称另一次1.7B训练在λ=0.1/0.3/1/2/4的Comp为84.6/84.1/85.0/85.3/82.6,与Table 12的上升不一致;同一检查点跨批只动0.7分。
    • Table 14为后一批,Comp+不同于Table 2的Comp。RepBend在作者系数下harm334 SRR 92.5%、xstest有用性45.3%、Comp+ 80.1;排斥系数0.1时Comp+ 79.1。同批AXIS三seed的Comp+为87.7/84.4/80.6。作者称RepBend的安全来自生成损坏,评审把重复读成拒绝,故其安全数字是上界。
    • Appendix I:1.7B的SimPER中,chosen每token对数似然从−4.4到−22.5,rejected从−0.2到−11.5;作者称这是训练崩溃。DOOR、Deep Alignment、Booster为195次更新,1.7B配方为417次。作者称三个基线只得到配方47%的更新。
    • Appendix F:675条校准上off-topic召回为0.03。盲注中α-DPO的xstest过拒为人工67.5%(n=80)、评审52.5%;Qwen3Guard-Gen-8B为81.2%,本文评审为54.3%。作者称两处分歧都与自己的主张相反,因此综合分领先是保守的。
    • 推理期(Section 4):等范数旋转无变化;沿r̂补回缺失投影能恢复拒绝,但作者称把约三分之一良性回答变成无意义文本。投影pc从裸现代汉语的761降到包装后的164–219。
    • 子串评审:引言称在334条留出包装意图上,拒答短语匹配把75%的WTA判为拒绝。Appendix G.1在4,342条harm334回答上,57短语表对WTA的拒绝判定为75.1%,对firm为86.5%。
  5. 有什么可以进一步探索的点?

    作者称表征说明是相关的,且1.7B共用剂量不是该模型的optimum。

    作者指出的局限与后续方向

    • 模型与seed:控制实验用一个小模型族;复现为4B两个seed、9B一个seed(Appendix A)。
    • 剂量:三个模型共用一个λrot,但它仍是在所报告集合上扫描选出的;在1.7B它不是逐模型optimum,代价为6.0个综合分,并让两个基线在两个攻击集上都更安全。1.7B的扫描也不能跨训练复现(Appendix A、Appendix L)。
    • 因果地位:表征说明是相关的、总体层面的。它在各模型与语域的匹配集合上成立,但不能预测模型会拒绝哪一条包装攻击。旋转项的收益只说明该方向可训练,不是它就是原因(Appendix A)。
    • 基线设置:基线用发表时的设置,没有在GUISE上重调。三个基线只得到配方47%的更新;1.7B上只有α-DPO与Booster有三个seed。RepBend的安全数字是上界,因为评审把重复读成拒绝(Appendix A)。
    • 评审来源:每条标题数字来自同一厂商的评审。guard模型的印证不均匀,人工标注不覆盖4B与9B的arm(Appendix A)。
    • 基准范围:作者在Appendix C称GUISE不是通用安全排行榜:它覆盖一种语言、一个语域族和一种攻击框架,评审在单一模型上校准,绝对率会随评审版本移动,因此比较应在同一批评审内逐项配对,并写明检测器。Appendix A另称专家修订核心很小,其余语料为机器生成并经审核。

    实验覆盖范围

    • 模型与seed:训练并逐模型报告结果的是Qwen3-1.7B、Qwen3-4B、GLM-4-9B(Section 6、Table 2)。1.7B主要arm为三个seed,4B两个,9B一个。
    • 评测集:主比较使用harm334、ood834、245条文言文XSTest,以及Table 2的对抗性良性有用性;Table 3另报普通良性过拒。Section 6的benign为300条。32条无再分发许可的意图被排除出发布和全部评测;其中23条(61对)仍用于训练所报告模型(Appendix E)。
    • 语域与体裁:平行语料含英文、现代汉语、文言文(1,011条有害、450条良性)。OOD体裁为史传笺注、律令律疏、师弟子问对,过滤后834条攻击、489条良性(Appendix D)。Table 4报告只在文言文上后训练后的三语域SRR。
    • 评审:标题数字来自deepseek-chat。Qwen3Guard-Gen-8B重评了13个arm的子集、四个集合(Appendix F)。盲注覆盖决定Section 7.1的1.7B arm;论文写明人工标注不覆盖4B与9B。
    • 对照与更新预算:五个外部方法按原论文系数重实现;SimPER与α-DPO为417次更新,DOOR、Deep Alignment、Booster为195次(Appendix I)。RepBend在另一批单独报告(Table 14)。Section 4另测了两种免训练的推理期校正。
  6. 总结一下论文的主要内容

    GUISE分开测包装与语域;AXIS用旋转和承诺项,作者称三模型Comp最高。

    作者测量叙事包装下的拒答失效,并训练一个在未见包装上拒绝、同时仍回答同风格良性请求的适配器。

    问题是:安全对齐模型拒绝直说的有害请求,却回答嵌进角色或叙事里的同一请求。文言文被用来把语域和包装拆开。受害系统是已对齐语言模型;成功由把WTA计为攻击成功的严格评审判定。

    GUISE用配对意图比较裸请求与包装、有害与良性,并提供英文、现代汉语、文言文,以及训练未见的三种文言体裁。AXIS在冻结权重上训练LoRA,损失是DPO加上旋转项和承诺项。旋转项把策略在文言裸请求上的有害减良性方向拉向现代汉语拒答方向;承诺项提高完整拒绝的概率;偏好项同时学拒绝有害请求和回答良性请求。主实验三模型共用λrot=0.1。

    • Table 1:基座Qwen3-1.7B的严格ASR,文言裸请求20.4%(334条留出意图),文言包装95.7%(1,067条意图);英文与现代汉语包装为89.4%与93.0%。作者称换语域跨6.3个百分点,包装上升约75个百分点。
    • 表征:裸现代汉语的有害减良性方向离拒答方向6–10°,包装后为77–86°。Figure 1标注从8.0°(6–10°)到81.1°(77–86°)。图注未写明8.0°的语域。
    • Table 2、seed 0:AXIS的Comp在Qwen3-1.7B、Qwen3-4B、GLM-4-9B上为78.4、92.9、93.7。作者称这是所比方法中最高。同表1.7B的harm334 SRR,AXIS为71.9%,α-DPO为99.4%,Booster为83.2%;后两者过拒为77.1%与51.8%,AXIS为9.8%。
    • Appendix M:综合分领先为1.7B +14.5、4B +3.0、9B +1.4。作者称9B的区间含0,该领先不显著;只看安全性时AXIS不是第一。
    • 消融:作者把留出包装上的泛化归到旋转项;去掉偏好项会拒绝27–41%的普通良性请求。Table 4中,只在文言文上后训练的1.7B适配器,对现代汉语和英文包装的SRR为68.1–73.7%。

    作者的结论是:驱动失效的是包装而不是语域;它让有害与良性仍然可分,但把分离方向转离拒答方向。AXIS把该方向训回去,并用承诺项把拒绝进行到结束,偏好项则保持良性请求得到回答。综合分领先随规模缩小。

阅读原文arxiv.org