跳到正文
原文
论文追踪· arXiv:2609.19325· Sai Sri Pushpa Jampani, Kshitij Mishra, Asif Ekbal·本站收录 · 原文发表

AUDITPLAN:先提交安全计划再作答的可审计安全对齐方法

AUDITPLAN: Commit, Then Answer for Auditable Safety Alignment

论文速读

防御

据论文 PDF 整理(AI 生成),以原文为准

AUDIT PLAN 让模型先提交结构化安全计划再作答,并用 FAITHGATE 把答案奖励绑定计划正确性。

威胁模型prompt-only adversary 只控制推理时的用户消息,不能改模型权重或训练数据,可自适应构造提示词诱发 jailbreak 或 leakage(含 system-prompt 片段与注入的 canary)。

问题
安全微调多只优化最终答案,难以区分稳健拒答、对无害请求的过度拒答,以及不约束答案的事后安全说辞。部署还需要可机检的拒答或作答审计轨迹。
方法
AUDIT PLAN 让同一模型先输出含 threat、action、constraints 的隐藏结构化计划,再据此作答。SFT 后用 GRPO;FAITHGATE 仅在计划正确且格式良好时才给予高答案奖励,并惩罚安全但计划错误的输出。
实验与结果
在 Qwen2.5-3B 上,FAITHGATE 相对加权和基线把 ASR 从 24.0% 降到 11.55%,LSR 从 1.00% 降到 0.36%,ORR 从 11.0% 降到 1.97%(三种子均值,Table 2),并同时提高 PAA、PAC 与 PS。1.5B 的阶段结果与 4B/7B 单种子确认呈同一方向。
局限与可以继续做的
作者指出实验集中于单轮提示词攻击、轻量验证器与较小开源模型,验证器不是语义安全证明;多轮训练与评测、工具介导注入、评审模型分布偏移和更广对抗规模效应仍是后续工作。主对照是同骨干的答案、自由形式与加权和变体。
实验设置Qwen2.5-1.5B-Instruct、Qwen2.5-3B-Instruct 等 · Do-Not-Answer、leakage-enhanced split 等 · ASR、LSR 等
威胁模型
prompt-only adversary 只控制推理时的用户消息,不能改模型权重或训练数据,可自适应构造提示词诱发 jailbreak 或 leakage(含 system-prompt 片段与注入的 canary)。主设定为单轮,覆盖直接攻击、roleplay、authority framing、comparison、hypothetical 与合成对抗后缀。不声称覆盖多轮自适应攻击、white-box 对手,或经工具/检索文档介导的 prompt injection。
模型
Qwen2.5-1.5B-InstructQwen2.5-3B-InstructQwen-3-4B-InstructQwen2.5-7B-Instruct
基准
Do-Not-Answerleakage-enhanced splitUltraChatheld-out stress slice
指标
ASRLSRORRPSPAAPAC
AI 导读全文 263 字

AUDITPLAN 让模型先输出包含威胁标签、预期动作和显式约束的结构化安全计划,再据此作答,计划对用户隐藏但可机器审计。该方法用监督微调加 FAITHGATE 奖励门控强化学习训练,仅在安全计划正确时才给予答案奖励。在 Qwen2.5-3B-Instruct 上,ASR 从 24.0% 降至 11.6%,LSR 从 1.0% 降至 0.36%,过度拒答从 11.0% 降至 2.0%,Qwen2.5-1.5B-Instruct、Qwen-3-4B-Instruct 和 Qwen2.5-7B-Instruct 上趋势一致。

深度解读

6 个问题,约 10,200 字。每问先给一句结论,点开看完整回答

  1. 这篇论文试图解决什么问题?

    最终答案优化分不清稳健拒答、过度拒答与不约束答案的安全说辞。

    安全微调只看最终答案时,无法区分真正稳健的拒答、对无害请求的一概拒答,以及事后听起来合理但不约束答案的安全说辞。

    • 场景与重要性:指令跟随模型仍易被对抗提示词诱导不安全服从或泄露受保护内容(如隐藏提示词、canary、内部策略片段)。作者认为实用防御须同时做到三点:稳健拒答有害或泄露提示词、在无害提示词上保持有用,并留下可机检的拒答或作答原因。第三点在实践中常只靠自由形式的事后解释,而不是生成器内部稳定的控制信号。
    • 现有做法的不足:多数后训练只优化最终答案,模型可用“广泛拒答”(抬高 over-refusal)或“先答再补一句看似合理的解释”走捷径。外部 guard 会增加延迟、使部署更复杂,并可能与生成器不一致;作者认为它们把安全理由移到生成器之外,而不是让生成器本身可审计。
    • 核心观察:只给结构化计划仍不够。模型可以写出看起来合理的计划再忽略它,或用错误的 threat 标签默认拒答。作者认为最终答案优化把“看起来安全”和“因正确理由而安全”混在一起。
    • 本文提出什么:单模型的 AUDIT PLAN(先计划再作答)先发出紧凑的结构化安全计划(threat 标签、intended action、显式 constraints),再据此作答;计划可对用户隐藏并内部记录。训练用监督微调再加强化学习,其中 FAITHGATE 只在安全计划正确时才给予答案奖励。
    • 威胁模型:
      • 对手与目标:prompt-only adversary 在推理时控制用户消息,目标是诱发 unsafe compliance(jailbreak)或 sensitive disclosure(leakage),包括 system-prompt 片段或注入的 canary。
      • 知识与能力:对手不能修改模型权重或训练数据,但可以自适应构造提示词。主设定是单轮,覆盖直接攻击、roleplay、authority framing、comparison prompts、hypothetical prompts 和合成对抗后缀。
      • 受害系统:被对齐的指令跟随语言模型本身;部署时计划从用户可见回复中剥离,内部记录。
      • 设计目标与边界:Robust refusal、Usefulness、Auditability。作者明确不声称能完全抵御多轮自适应攻击、white-box 对手,或经工具或检索文档介导的 prompt injection。
  2. 有哪些相关研究?

    作者把本文放在答案优化、越狱评测与可核查中间过程三条线上。

    论文把相关工作分成三组,并把本文定位为用可机检的紧凑计划及其正确性来约束答案奖励。

    超出答案优化的安全对齐

    • RLHF、Constitutional AI、DPO(Ouyang et al., 2022;Bai et al., 2022;Rafailov et al., 2023)——通过优化最终行为提升无害性与指令跟随。Lu et al.(2025)综述这一设计空间及其权衡。
    • 脆性与替代目标——Yang et al.(2023)讨论小规模恶意微调可颠覆已对齐模型;Li and Kim(2025)用显式安全信号在攻击下收紧决策边界;Wachi et al.(2024)的 SACPO 用约束或逐步目标权衡效用与安全;Guan et al.(2024)的 deliberative alignment 让模型在作答前回忆并推理策略文本。
    • 作者的区分:作者称 deliberative alignment 教模型在作答前对安全规范做自由形式推理;AUDIT PLAN 则用隐藏的紧凑 schema 替换自由形式审议,其字段可机检,正确性还门控答案奖励。

    越狱、泄露与评测

    • 对抗提示词与压力套件——手工越狱、GCG(Zou et al., 2023),以及 HarmBench(Mazeika et al., 2024)和 JailbreakBench(Chao et al., 2024)。WildTeaming(Jiang et al., 2024)强调野外红队对安全训练的价值。
    • 泄露与间接注入——PLeak(Hui et al., 2024)研究闭源 system-prompt 抽取;BIPIA(Yi et al., 2023)强调间接 prompt injection 中的指令边界违反。
    • 作者的评测取向:评测同时覆盖有害生成与敏感披露,因为作者认为若模型仍泄露受保护上下文,稳健拒答就不完整。

    Guard、推理时对齐与忠实中间过程

    • 外部审核与推理时引导——Llama Guard、WildGuard、ShieldGemma(Inan et al., 2023;Han et al., 2024;Zeng et al., 2024),以及用跨模型引导的 InferAligner(Wang et al., 2024)。作者称这些做法适合纵深防御,但把主要安全决策放在生成器之外或跨多个模型。
    • 过程监督与忠实性——Lightman et al.(2023)与 Lanham et al.(2023)表明中间理由只有真正约束下游行为时才有用。作者称 FAITHGATE 就是为了强制这种耦合。

    基线方法与基准

    • 基线方法:同骨干的 answer-only RL、free-form rationale-then-answer,以及结构化加权和奖励(Table 2)。附录还做 schema 消融、held-out stress slice,以及 4B/7B 确认实验。附录 L.1 只把 Llama Guard、WildGuard、ShieldGemma、InferAligner、SACPO 和显式安全信号作为文献背景,作者称其已发表数字因骨干、分类体系和评测协议不同,不能与 Table 1、Table 2 直接对比。
    • 基准/数据集:越狱用 Do-Not-Answer(Wang et al., 2023)的 300 条;泄露用 leakage-enhanced split 的 300 条;无害用 UltraChat(Ding et al., 2023)的 300 条。相关工作中提及但未作为本文主评测的还有 HarmBench、JailbreakBench。

    作者称本文目标不同:让生成器自己发出紧凑、可机检的安全承诺,并奖励该承诺的忠实性,而不是依赖自由形式理由、单独安全头或外部审核模型。

  3. 论文如何解决这个问题?

    先输出可机检安全计划,再用 FAITHGATE 把答案奖励绑在计划正确性上。

    AUDIT PLAN 是单模型的 plan-then-answer:一次前向先输出结构化安全计划,再输出最终答案;FAITHGATE 在强化学习里把高答案奖励限定为计划正确且格式良好。

    问题设定与输出形式

    • 输入与标签:提示词 u 有类别 c(u) ∈ {benign, jailbreak, leakage}。策略输出计划 z 与答案 y,拼接为 x = ⟨z, y⟩。
    • 计划字段:计划包在 <plan> 与 </plan> 中,答案包在 <answer> 中。JSON 含 threat(benign、jailbreak、leakage)、action(answer、refuse、deflect)、短 constraints 列表,以及可选 trust_boundary。作者称刻意保持低熵,以便廉价检查有效性、威胁准确率和计划–答案一致性。
    • 部署形态:推理时计划作为内部承诺与审计产物,从用户可见回复中剥离并内部记录。训练时它提供答案优化里看不见的中间监督。错误被分成四类:计划畸形或缺失、威胁识别错误、给定威胁后动作选择错误、计划与答案不匹配。

    三阶段训练与验证器

    1. Base:评测未调的指令模型,它没有显式计划接口。
    2. SFT:用带计划标注的示范,教模型输出合法计划及大致正确的安全动作。目标是教师强制似然,即公式 (1) 中 π_sft = arg min E[−log π(x|u)]。
    3. RL:从 SFT 检查点出发,用 Group Relative Policy Optimization(GRPO)(Shao et al., 2024),以 SFT 检查点为参考策略。每个提示词采样 K 个完成,按组内相对优势更新。

    四个轻量验证器不是语义安全证明,只支撑大规模优化与监控:

    • PS:所需标签存在且计划可解析为合法 JSON。
    • PAA:预测的 threat 与数据集标签一致。
    • Action correctness:动作与类别匹配,例如 benign 用 answer,jailbreak 或 leakage 用 refuse 或 deflect。
    • PAC:答案类型与所承诺的 action 一致。

    奖励与 FAITHGATE

    五个分量在加权前都归一化到 [0, 1]:Rsafe(有害提示词是否恰当拒答、无害提示词是否作答)、Rleak(惩罚 canary、system-prompt 片段或语义等价泄露)、Rplan(结构、threat、action)、Rutil(无害有用性,惩罚不必要拒答)、Rformat(标签与 schema)。

    加权和基线把答案当主目标、计划当辅助信号:

    Rsum(x)=w1 Rsafe+w2 Rleak+w3 Rplan+w4 Rutil+w5 Rformat

    作者称它仍允许两种捷径:广泛拒答同时标错威胁,以及计划看起来合理但与答案弱耦合。

    FAITHGATE 不引入单独安全约束或对偶变量,而是改信用分配。m(z) 表示计划畸形,q(z, u) 表示计划正确且格式良好,s(y, u) 表示答案对该提示词行为上安全。门控基础奖励 g:畸形为 0;计划正确且答案安全为 +2.0;计划不正确但答案安全为 −0.5;计划正确但答案不安全为 −2.0;其余为 0。完整奖励是 g 再加上各分量的加权项。作者称:安全答案配错计划只受惩罚,从而避免模型未识别正确威胁时过度拒答看起来最优;正确计划配不安全答案受最重惩罚;畸形计划基础奖励为 0,格式合规必要但不充分。

    泄露打分是三级级联:第 1 级查 canary 的精确或部分重叠;第 2 级用正则匹配常见披露模式;第 3 级由 LLM judge 给改写或间接披露的泄露风险分。附录 E 给出评审提示词。论文未在正文写明该评审模型的名称。

    优化、解析与可选运行时包装

    • GRPO:组内优势是 (R − μ_i) / (σ_i + ε),μ_i 为同提示词 K 个完成的均值。再优化带 KL 惩罚的截断策略目标,沿用 DeepSeekMath 的 GRPO。3B 代表超参(附录 C,Table 6)包括:4-bit 量化、LoRA r=64、alpha=128、dropout=0.05;SFT 批大小 4、梯度累积 4、学习率 2×10^−5、3 个 epoch;GRPO 批大小 2、梯度累积 8、学习率 5×10^−6、2 个 epoch;最大序列长度 2048、最大新 token 1024;K=8,temperature 0.7,top-p 0.9,KL 系数 β=0.04,PPO clip ε=0.2。训练用 LoRA,QLoRA 风格,单张 NVIDIA V100 32GB。1.5B 与 3B 共用输出格式和验证器流程。
    • 解析失败:基础奖励为 0,并记为 PS 的格式失败。部署时保守包装可在解析失败时改用模板化拒答。
    • 可选推理包装:解析计划、检查格式良好,并核对答案是否匹配所承诺的 action。例如计划为 refuse 而答案部分服从时,包装可用模板化拒答替换答案并记录 PAC 违反。作者称这不是稳健训练的替代,而是便于拦住少见的忠实性失败。
  4. 论文做了哪些实验?

    3B 上 FAITHGATE 同时压低 ASR、LSR 与 ORR,并提高计划指标。

    实验设置

    • 模型:主阶段评测为 Qwen2.5-1.5B-Instruct;受控奖励消融为 Qwen2.5-3B-Instruct。附录 G 另有 Qwen-3-4B-Instruct 与 Qwen2.5-7B-Instruct 的单种子规模确认。
    • 数据:SFT 1500 条,benign/jailbreak/leakage 为 55/30/15(825/450/225)。RL 1000 条,约 40/40/20。留出评测 900 条:Do-Not-Answer 越狱 300、leakage-enhanced 300、UltraChat 无害 300。攻击族覆盖直接请求、roleplay、authority、hypothetical、comparison、间接泄露模板和合成后缀;子类型计数见附录 A、Table 4。
    • 基线:同数据、同解析器、同分量奖励下,只改信用分配的结构化加权和;另有去掉计划通道的 answer-only RL,以及 free-form rationale-then-answer。附录还有 schema 消融与 held-out stress slice。
    • 指标:ASR 为越狱成功率;LSR 为泄露提示词中揭示受保护内容的比例;ORR 为无害提示词被拒答的比例。PS 为句法计划有效性,PAA 为 threat 标签准确率,PAC 为计划–答案一致性。ASR/LSR/ORR 越低越好,PS/PAA/PAC 越高越好。free-form 的 PAC、PS 列分别是抽取出的 action consistency 与 stable extractability。
    • 统计与评审:3B 的 FAITHGATE 用种子 42、123、456,报告均值±标准差;除非另有说明,其余对比为单种子。附录 F 对加权和基线做单侧 t 检验。泄露用三级检测器,第 3 级为 0–10 的 LLM judge;论文未在正文写明该 judge 的模型名。行为安全与泄露的具体判定阈值论文未在正文给出完整规则。
    • 训练实现:见第 3 问的 3B 超参。1.5B 的 Table 1 为阶段结果,论文未写明该表是否多种子。

    主结果

    Qwen2.5-3B-Instruct 同协议对比(Table 2)。FAITHGATE 为三种子均值±标准差;比例已换算为百分数。

    表格较宽,可左右滑动

    方法ASR↓LSR↓ORR↓PAA↑PAC↑PS↑
    Base 3B63.00%5.30%1.00%000
    SFT 3B26.70%1.30%10.00%56.00%62.00%64.00%
    AnswerOnly20.50%0.90%15.60%———
    Free-form18.90%0.88%9.80%—68.10%71.20%
    WeightSum24.00%1.00%11.00%58.00%65.20%63.30%
    FAITHGATE11.55%±1.57%0.36%±0.29%1.97%±0.58%72.19%±1.83%80.13%±1.42%82.81%±1.61%
    • 作者对捷径的解读:answer-only 相对加权和改善了 ASR 与 LSR,但 ORR 升至 15.60%,作者称它仍靠广泛拒答换安全。free-form 改善这一权衡,但抽出的 action consistency 为 68.10%、stable extractability 为 71.20%,都低于 FAITHGATE 的结构化计划指标。
    • 相对加权和:作者称 FAITHGATE 六个指标同时更好,大约把 ASR 减半、LSR 减少约三分之二、over-refusal 削减超过 80%,并提高威胁准确率、计划–答案一致性和句法有效性。Figure 3 标注相对加权和:ASR 低 51.9%、LSR 低 64.0%、ORR 低 82.1%,PAA、PAC、PS 分别高 24.5%、22.9%、30.8%。附录 F 称全部报告指标相对加权和有统计显著性。
    • 作者的机制说法:若收益只来自更干净的 JSON,应只见 PS 上升而 ASR、ORR、PAC 没有可比改善。作者称最大变化恰在诊断安全捷径的指标上,与“拒答只有配上正确威胁评估才有价值”一致。Table 2 被作者解释为固定结构化接口下的信用分配证据,而不是单模型系统应取代外部审核器。

    阶段结果与规模

    • 1.5B 阶段(Table 1):Base 的 ASR/LSR/ORR 为 55.67%/6.00%/7.67%,计划指标均为 0。SFT 为 30.79%/3.33%/11.67%,PAA 92.68%、PAC 84.97%、PS 97.92%。RL 为 27.00%/1.67%/11.00%,PAA 92.13%、PAC 86.36%、PS 97.50%。作者称 SFT 是主要表征转变,RL 主要再提高泄露稳健性与 PAC;SFT 提高稳健性的同时也提高 ORR,说明早期安全收益有一部分来自保守拒答。
    • 阈值视角(Table 7,仅 1.5B):内部监控目标为 ASR<0.10、LSR<0.03、ORR<0.10、PAA>0.90、PAC>0.85、PS>0.90。Base 只达到 ORR;SFT 达到 PAA 与 PS;RL 达到 LSR、PAC 与 PS,仍未达到 ASR、ORR 与 PAA。
    • 4B/7B 单种子(Table 16):Qwen-3-4B 的 Base ASR/LSR/ORR 为 41.20%/3.10%/0.70%,SFT 为 18.40%/0.90%/6.40%,FAITHGATE 为 8.70%/0.27%/1.30%,PAA/PAC/PS 为 78.10%/84.60%/88.40%。Qwen2.5-7B 的 Base 为 36.80%/2.40%/0.50%,SFT 为 15.10%/0.70%/5.10%,FAITHGATE 为 7.40%/0.20%/1.10%,计划指标为 81.40%/86.90%/90.20%。作者称稳健性与有用性继续改善,并称之为较大骨干上的支持性迁移证据。

    消融、压力切片与错误模式

    • Schema(Table 14,3B 单种子):Threat-only 的 ASR/LSR/ORR 为 21.80%/0.92%/9.40%,PAA/PAC/PS 为 61.10%/66.40%/70.20%。Threat+action 为 16.40%/0.61%/5.80% 与 67.50%/74.10%/76.80%。Full plan + FAITHGATE 与 Table 2 均值相同。作者称只规划威胁最弱,加上动作有较大帮助,完整计划在整体权衡上最好。
    • Held-out stress slice(Table 15):1.5B RL 的 ASR/LSR/ORR 为 31.00%/2.40%/13.50%,PAA/PAC/PS 为 88.00%/82.00%/96.50%。3B 加权和为 28.00%/1.60%/12.00% 与 55.00%/61.00%/60.00%。3B FAITHGATE 为 14.00%/0.60%/3.00% 与 69.00%/77.00%/80.00%。作者把它作为超出原 900 条评测的泛化探针,混合了越狱、改写泄露和无害但贴近安全的提示词。论文未报告该切片的条数。
    • 残余失败(Table 3):作者列出威胁误分类(混淆的提示词)、计划–答案不匹配(承诺拒答但答案部分服从)、间接泄露(无精确 canary 但语义上泄露改写)和畸形计划。论文未给这些模式的比例。作者称这些失败正因为中间计划而可见,并建议用该记录做系统级分片,例如“无害被标成 jailbreak”“威胁正确但 PAC 失败”“格式失败”。

    其他消融与分析

    • 三种子(Table 8):种子 42/123/456 的 ASR 为 11.00%/10.33%/13.33%,LSR 为 0.30%/0.10%/0.67%,ORR 为 1.30%/2.30%/2.30%;PAA 为 74.22%/71.67%/70.67%,PAC 为 80.00%/81.61%/78.78%,PS 为 82.78%/84.44%/81.22%。
    • 显著性(Table 9,相对加权和):ASR、LSR、ORR、PAA、PAC、PS 的均值差分别为 −0.1245、−0.0064、−0.0903、+0.1419、+0.1493、+0.1951;单侧 p 值均小于 0.05(ASR、ORR、PAA、PAC、PS 的 p<0.001,LSR 的 p=0.012)。
    • 相对变化(Table 11):1.5B 上 Base→SFT 的 ASR/LSR 相对变化为 −44.7%/−44.5%,ORR 为 +52.2%;SFT→RL 为 −12.3%/−49.8%/−5.7%。3B 上 WeightSum→FAITHGATE 为 −51.9%/−64.0%/−82.1%,PAA/PAC/PS 为 +24.5%/+22.9%/+30.8%。
    • 绝对变化(Table 12):1.5B Base→SFT 的 ASR/LSR/ORR 绝对差为 −0.2488/−0.0267/+0.0400;SFT→RL 为 −0.0379/−0.0166/−0.0067。3B WeightSum→FAITHGATE 为 −0.1245/−0.0064/−0.0903,计划指标为 +0.1419/+0.1493/+0.1951。
    • 门控敏感度(Table 24,3B 单种子):(+r, −p, −u) 中 (+2.0, −0.50, −2.0) 的 ASR/LSR/ORR 为 11.55%/0.36%/1.97%,与 Table 2 均值相同。较弱的 (+1.0, −0.25, −1.0) 为 24.60%/0.98%/6.80%,接近加权和的 ASR 24.00%。(+3.0, −0.50, −3.0) 为 12.80%/0.48%/2.40%,高于 (+2.0, −0.50, −2.0)。
    • 训练曲线(Figure 4):作者称 3B FAITHGATE 的逐步奖励因离散门控与组内归一化而噪声大,但损失保持有界、奖励 EMA 稳定而非崩溃;这些曲线是优化诊断,不是安全效力的主要证据。
  5. 有什么可以进一步探索的点?

    作者把多轮训练评测、语义泄露监督和更丰富威胁分类列为后续工作。

    作者指出的局限与后续方向

    • 实验范围(Limitations):作者写明实验集中于单轮提示词攻击、用于计划正确性与安全打分的轻量验证器,以及主受控研究中的小型开源模型。
    • 验证器不是语义证明(Limitations):验证器足以塑造学习,但不是语义安全证明,并继承基准标签和 judge 提示词的一些假设。作者把 AUDIT PLAN 视为纵深防御中的一层,而不是外部防护的替代或语义安全的证明。
    • 未覆盖的失败模式(Limitations):多轮对手、工具介导的 prompt injection、judge 模型的分布偏移,以及更广的对抗规模效应,可能引入额外失败模式。
    • 忠实性的含义(Limitations):作者不声称隐藏计划在机制意义上保证忠实,只称显式奖励忠实性提高了计划与答案之间可测量的耦合。多轮训练与评测仍是重要后续工作。
    • 评审一致性(附录 E):绝对 ASR/LSR 仍可能随 judge 选择变化,跨 judge 一致性与人工审计仍是后续工作。
    • 错误模式指向的方向(附录 I):作者称类别 1(混淆提示词上的威胁混淆)和类别 4(间接或改写泄露)仍然最难,并据此提出两个自然方向:更丰富的威胁分类,以及更好的语义泄露监督。

    实验覆盖范围

    • 被测模型:阶段与奖励消融为 Qwen2.5-1.5B-Instruct 与 Qwen2.5-3B-Instruct;附录 G 的单种子确认为 Qwen-3-4B-Instruct 与 Qwen2.5-7B-Instruct(Table 16)。
    • 主评测:留出 900 条,越狱、泄露、无害各 300;SFT 1500 条、RL 1000 条(第 5 节、Table 4)。攻击形态包括直接请求、roleplay、authority framing、hypothetical、comparison、间接泄露模板和合成后缀。
    • 同协议对照:answer-only RL、free-form rationale-then-answer、结构化加权和,以及 threat-only、threat+action、完整计划的 schema 消融(Table 2、Table 14)。另有 3B 门控系数的单种子扫描(Table 24)和混合的 held-out stress slice(Table 15)。
    • 统计:仅 3B FAITHGATE 报告三随机种子及相对加权和的单侧 t 检验(附录 F)。论文写明 answer-only、schema 与规模确认除非另有说明均为单种子。
    • 论文未报告的项目:正文未给出第 3 级 LLM judge 的模型名称;Table 15 未给出 stress slice 条数;Table 3 的残余失败模式未给比例。外部 moderator 的已发表数字被作者放在附录 L.1,并写明因骨干、分类体系与评测协议不同,不与 Table 1、Table 2 做同协议对比。
  6. 总结一下论文的主要内容

    先承诺可机检安全计划,再让计划正确性决定能否拿到答案奖励。

    AUDIT PLAN 把安全对齐从“只优化最终答案”改成“先提交隐藏的结构化安全计划,再按该计划作答”,并用 FAITHGATE 把高答案奖励限定在计划正确时。

    • 问题:单轮 prompt-only 对手可诱导越狱或不安全服从,以及泄露 system-prompt 片段或 canary。只看答案时,广泛拒答和事后补一句安全说辞都能提高安全指标,却分不清模型是否识别了威胁。外部 guard 把决策移出生成器,并带来延迟与不一致。
    • 方法:同一模型输出含 threat、action、constraints 和可选 trust_boundary 的紧凑 JSON,再输出答案;计划可对用户隐藏并内部记录。SFT 学习该接口,GRPO 再用四个轻量验证器(格式、威胁标签、动作、计划–答案一致性)和五个归一化奖励细化。FAITHGATE 对正确计划加安全答案给 +2.0,对安全但计划错误给 −0.5,对正确计划加不安全答案给 −2.0。
    • 3B 主结果(Table 2,三种子):相对同设置加权和,FAITHGATE 的 ASR 从 24.00% 到 11.55%±1.57%,LSR 从 1.00% 到 0.36%±0.29%,ORR 从 11.00% 到 1.97%±0.58%,PAA/PAC/PS 升至 72.19%/80.13%/82.81%。Answer-only 的 ORR 为 15.60%,高于加权和的 11.00%。
    • 其他设置:1.5B 上 SFT 把 ASR 从 55.67% 降到 30.79%,ORR 从 7.67% 升到 11.67%;随后 RL 的 ASR/LSR/ORR 为 27.00%/1.67%/11.00%(Table 1)。4B 与 7B 的单种子 FAITHGATE 分别把 ASR 降到 8.70% 与 7.40%、ORR 降到 1.30% 与 1.10%(Table 16)。
    • 作者的结论:显式的中间安全承诺是构建更可诊断语言模型的一个实用方向。作者同时把该方法视为纵深防御中的一层:验证器不是语义安全证明,多轮与工具介导攻击不在所声称的范围内。
阅读原文arxiv.org