AUDITPLAN:先提交安全计划再作答的可审计安全对齐方法
AUDITPLAN: Commit, Then Answer for Auditable Safety Alignment
AUDIT PLAN 让模型先提交结构化安全计划再作答,并用 FAITHGATE 把答案奖励绑定计划正确性。
prompt-only adversary 只控制推理时的用户消息,不能改模型权重或训练数据,可自适应构造提示词诱发 jailbreak 或 leakage(含 system-prompt 片段与注入的 canary)。
- 安全微调多只优化最终答案,难以区分稳健拒答、对无害请求的过度拒答,以及不约束答案的事后安全说辞。部署还需要可机检的拒答或作答审计轨迹。
- AUDIT PLAN 让同一模型先输出含 threat、action、constraints 的隐藏结构化计划,再据此作答。SFT 后用 GRPO;FAITHGATE 仅在计划正确且格式良好时才给予高答案奖励,并惩罚安全但计划错误的输出。
- 在 Qwen2.5-3B 上,FAITHGATE 相对加权和基线把 ASR 从 24.0% 降到 11.55%,LSR 从 1.00% 降到 0.36%,ORR 从 11.0% 降到 1.97%(三种子均值,Table 2),并同时提高 PAA、PAC 与 PS。1.5B 的阶段结果与 4B/7B 单种子确认呈同一方向。
- 作者指出实验集中于单轮提示词攻击、轻量验证器与较小开源模型,验证器不是语义安全证明;多轮训练与评测、工具介导注入、评审模型分布偏移和更广对抗规模效应仍是后续工作。主对照是同骨干的答案、自由形式与加权和变体。
- 威胁模型
- prompt-only adversary 只控制推理时的用户消息,不能改模型权重或训练数据,可自适应构造提示词诱发 jailbreak 或 leakage(含 system-prompt 片段与注入的 canary)。主设定为单轮,覆盖直接攻击、roleplay、authority framing、comparison、hypothetical 与合成对抗后缀。不声称覆盖多轮自适应攻击、white-box 对手,或经工具/检索文档介导的 prompt injection。
- 模型
- Qwen2.5-1.5B-InstructQwen2.5-3B-InstructQwen-3-4B-InstructQwen2.5-7B-Instruct
- 基准
- Do-Not-Answerleakage-enhanced splitUltraChatheld-out stress slice
- 指标
- ASRLSRORRPSPAAPAC
AUDITPLAN 让模型先输出包含威胁标签、预期动作和显式约束的结构化安全计划,再据此作答,计划对用户隐藏但可机器审计。该方法用监督微调加 FAITHGATE 奖励门控强化学习训练,仅在安全计划正确时才给予答案奖励。在 Qwen2.5-3B-Instruct 上,ASR 从 24.0% 降至 11.6%,LSR 从 1.0% 降至 0.36%,过度拒答从 11.0% 降至 2.0%,Qwen2.5-1.5B-Instruct、Qwen-3-4B-Instruct 和 Qwen2.5-7B-Instruct 上趋势一致。
深度解读
这篇论文试图解决什么问题?
最终答案优化分不清稳健拒答、过度拒答与不约束答案的安全说辞。
安全微调只看最终答案时,无法区分真正稳健的拒答、对无害请求的一概拒答,以及事后听起来合理但不约束答案的安全说辞。
- 场景与重要性:指令跟随模型仍易被对抗提示词诱导不安全服从或泄露受保护内容(如隐藏提示词、canary、内部策略片段)。作者认为实用防御须同时做到三点:稳健拒答有害或泄露提示词、在无害提示词上保持有用,并留下可机检的拒答或作答原因。第三点在实践中常只靠自由形式的事后解释,而不是生成器内部稳定的控制信号。
- 现有做法的不足:多数后训练只优化最终答案,模型可用“广泛拒答”(抬高 over-refusal)或“先答再补一句看似合理的解释”走捷径。外部 guard 会增加延迟、使部署更复杂,并可能与生成器不一致;作者认为它们把安全理由移到生成器之外,而不是让生成器本身可审计。
- 核心观察:只给结构化计划仍不够。模型可以写出看起来合理的计划再忽略它,或用错误的 threat 标签默认拒答。作者认为最终答案优化把“看起来安全”和“因正确理由而安全”混在一起。
- 本文提出什么:单模型的 AUDIT PLAN(先计划再作答)先发出紧凑的结构化安全计划(threat 标签、intended action、显式 constraints),再据此作答;计划可对用户隐藏并内部记录。训练用监督微调再加强化学习,其中 FAITHGATE 只在安全计划正确时才给予答案奖励。
- 威胁模型:
- 对手与目标:prompt-only adversary 在推理时控制用户消息,目标是诱发 unsafe compliance(jailbreak)或 sensitive disclosure(leakage),包括 system-prompt 片段或注入的 canary。
- 知识与能力:对手不能修改模型权重或训练数据,但可以自适应构造提示词。主设定是单轮,覆盖直接攻击、roleplay、authority framing、comparison prompts、hypothetical prompts 和合成对抗后缀。
- 受害系统:被对齐的指令跟随语言模型本身;部署时计划从用户可见回复中剥离,内部记录。
- 设计目标与边界:Robust refusal、Usefulness、Auditability。作者明确不声称能完全抵御多轮自适应攻击、white-box 对手,或经工具或检索文档介导的 prompt injection。
有哪些相关研究?
作者把本文放在答案优化、越狱评测与可核查中间过程三条线上。
论文把相关工作分成三组,并把本文定位为用可机检的紧凑计划及其正确性来约束答案奖励。
超出答案优化的安全对齐
- RLHF、Constitutional AI、DPO(Ouyang et al., 2022;Bai et al., 2022;Rafailov et al., 2023)——通过优化最终行为提升无害性与指令跟随。Lu et al.(2025)综述这一设计空间及其权衡。
- 脆性与替代目标——Yang et al.(2023)讨论小规模恶意微调可颠覆已对齐模型;Li and Kim(2025)用显式安全信号在攻击下收紧决策边界;Wachi et al.(2024)的 SACPO 用约束或逐步目标权衡效用与安全;Guan et al.(2024)的 deliberative alignment 让模型在作答前回忆并推理策略文本。
- 作者的区分:作者称 deliberative alignment 教模型在作答前对安全规范做自由形式推理;AUDIT PLAN 则用隐藏的紧凑 schema 替换自由形式审议,其字段可机检,正确性还门控答案奖励。
越狱、泄露与评测
- 对抗提示词与压力套件——手工越狱、GCG(Zou et al., 2023),以及 HarmBench(Mazeika et al., 2024)和 JailbreakBench(Chao et al., 2024)。WildTeaming(Jiang et al., 2024)强调野外红队对安全训练的价值。
- 泄露与间接注入——PLeak(Hui et al., 2024)研究闭源 system-prompt 抽取;BIPIA(Yi et al., 2023)强调间接 prompt injection 中的指令边界违反。
- 作者的评测取向:评测同时覆盖有害生成与敏感披露,因为作者认为若模型仍泄露受保护上下文,稳健拒答就不完整。
Guard、推理时对齐与忠实中间过程
- 外部审核与推理时引导——Llama Guard、WildGuard、ShieldGemma(Inan et al., 2023;Han et al., 2024;Zeng et al., 2024),以及用跨模型引导的 InferAligner(Wang et al., 2024)。作者称这些做法适合纵深防御,但把主要安全决策放在生成器之外或跨多个模型。
- 过程监督与忠实性——Lightman et al.(2023)与 Lanham et al.(2023)表明中间理由只有真正约束下游行为时才有用。作者称 FAITHGATE 就是为了强制这种耦合。
基线方法与基准
- 基线方法:同骨干的 answer-only RL、free-form rationale-then-answer,以及结构化加权和奖励(Table 2)。附录还做 schema 消融、held-out stress slice,以及 4B/7B 确认实验。附录 L.1 只把 Llama Guard、WildGuard、ShieldGemma、InferAligner、SACPO 和显式安全信号作为文献背景,作者称其已发表数字因骨干、分类体系和评测协议不同,不能与 Table 1、Table 2 直接对比。
- 基准/数据集:越狱用 Do-Not-Answer(Wang et al., 2023)的 300 条;泄露用 leakage-enhanced split 的 300 条;无害用 UltraChat(Ding et al., 2023)的 300 条。相关工作中提及但未作为本文主评测的还有 HarmBench、JailbreakBench。
作者称本文目标不同:让生成器自己发出紧凑、可机检的安全承诺,并奖励该承诺的忠实性,而不是依赖自由形式理由、单独安全头或外部审核模型。
论文如何解决这个问题?
先输出可机检安全计划,再用 FAITHGATE 把答案奖励绑在计划正确性上。
AUDIT PLAN 是单模型的 plan-then-answer:一次前向先输出结构化安全计划,再输出最终答案;FAITHGATE 在强化学习里把高答案奖励限定为计划正确且格式良好。
问题设定与输出形式
- 输入与标签:提示词 u 有类别 c(u) ∈ {benign, jailbreak, leakage}。策略输出计划 z 与答案 y,拼接为 x = ⟨z, y⟩。
- 计划字段:计划包在
<plan>与</plan>中,答案包在<answer>中。JSON 含 threat(benign、jailbreak、leakage)、action(answer、refuse、deflect)、短 constraints 列表,以及可选 trust_boundary。作者称刻意保持低熵,以便廉价检查有效性、威胁准确率和计划–答案一致性。 - 部署形态:推理时计划作为内部承诺与审计产物,从用户可见回复中剥离并内部记录。训练时它提供答案优化里看不见的中间监督。错误被分成四类:计划畸形或缺失、威胁识别错误、给定威胁后动作选择错误、计划与答案不匹配。
三阶段训练与验证器
- Base:评测未调的指令模型,它没有显式计划接口。
- SFT:用带计划标注的示范,教模型输出合法计划及大致正确的安全动作。目标是教师强制似然,即公式 (1) 中 π_sft = arg min E[−log π(x|u)]。
- RL:从 SFT 检查点出发,用 Group Relative Policy Optimization(GRPO)(Shao et al., 2024),以 SFT 检查点为参考策略。每个提示词采样 K 个完成,按组内相对优势更新。
四个轻量验证器不是语义安全证明,只支撑大规模优化与监控:
- PS:所需标签存在且计划可解析为合法 JSON。
- PAA:预测的 threat 与数据集标签一致。
- Action correctness:动作与类别匹配,例如 benign 用 answer,jailbreak 或 leakage 用 refuse 或 deflect。
- PAC:答案类型与所承诺的 action 一致。
奖励与 FAITHGATE
五个分量在加权前都归一化到 [0, 1]:Rsafe(有害提示词是否恰当拒答、无害提示词是否作答)、Rleak(惩罚 canary、system-prompt 片段或语义等价泄露)、Rplan(结构、threat、action)、Rutil(无害有用性,惩罚不必要拒答)、Rformat(标签与 schema)。
加权和基线把答案当主目标、计划当辅助信号:
Rsum(x)=w1 Rsafe+w2 Rleak+w3 Rplan+w4 Rutil+w5 Rformat
作者称它仍允许两种捷径:广泛拒答同时标错威胁,以及计划看起来合理但与答案弱耦合。
FAITHGATE 不引入单独安全约束或对偶变量,而是改信用分配。m(z) 表示计划畸形,q(z, u) 表示计划正确且格式良好,s(y, u) 表示答案对该提示词行为上安全。门控基础奖励 g:畸形为 0;计划正确且答案安全为 +2.0;计划不正确但答案安全为 −0.5;计划正确但答案不安全为 −2.0;其余为 0。完整奖励是 g 再加上各分量的加权项。作者称:安全答案配错计划只受惩罚,从而避免模型未识别正确威胁时过度拒答看起来最优;正确计划配不安全答案受最重惩罚;畸形计划基础奖励为 0,格式合规必要但不充分。
泄露打分是三级级联:第 1 级查 canary 的精确或部分重叠;第 2 级用正则匹配常见披露模式;第 3 级由 LLM judge 给改写或间接披露的泄露风险分。附录 E 给出评审提示词。论文未在正文写明该评审模型的名称。
优化、解析与可选运行时包装
- GRPO:组内优势是 (R − μ_i) / (σ_i + ε),μ_i 为同提示词 K 个完成的均值。再优化带 KL 惩罚的截断策略目标,沿用 DeepSeekMath 的 GRPO。3B 代表超参(附录 C,Table 6)包括:4-bit 量化、LoRA r=64、alpha=128、dropout=0.05;SFT 批大小 4、梯度累积 4、学习率 2×10^−5、3 个 epoch;GRPO 批大小 2、梯度累积 8、学习率 5×10^−6、2 个 epoch;最大序列长度 2048、最大新 token 1024;K=8,temperature 0.7,top-p 0.9,KL 系数 β=0.04,PPO clip ε=0.2。训练用 LoRA,QLoRA 风格,单张 NVIDIA V100 32GB。1.5B 与 3B 共用输出格式和验证器流程。
- 解析失败:基础奖励为 0,并记为 PS 的格式失败。部署时保守包装可在解析失败时改用模板化拒答。
- 可选推理包装:解析计划、检查格式良好,并核对答案是否匹配所承诺的 action。例如计划为 refuse 而答案部分服从时,包装可用模板化拒答替换答案并记录 PAC 违反。作者称这不是稳健训练的替代,而是便于拦住少见的忠实性失败。
论文做了哪些实验?
3B 上 FAITHGATE 同时压低 ASR、LSR 与 ORR,并提高计划指标。
实验设置
- 模型:主阶段评测为 Qwen2.5-1.5B-Instruct;受控奖励消融为 Qwen2.5-3B-Instruct。附录 G 另有 Qwen-3-4B-Instruct 与 Qwen2.5-7B-Instruct 的单种子规模确认。
- 数据:SFT 1500 条,benign/jailbreak/leakage 为 55/30/15(825/450/225)。RL 1000 条,约 40/40/20。留出评测 900 条:Do-Not-Answer 越狱 300、leakage-enhanced 300、UltraChat 无害 300。攻击族覆盖直接请求、roleplay、authority、hypothetical、comparison、间接泄露模板和合成后缀;子类型计数见附录 A、Table 4。
- 基线:同数据、同解析器、同分量奖励下,只改信用分配的结构化加权和;另有去掉计划通道的 answer-only RL,以及 free-form rationale-then-answer。附录还有 schema 消融与 held-out stress slice。
- 指标:ASR 为越狱成功率;LSR 为泄露提示词中揭示受保护内容的比例;ORR 为无害提示词被拒答的比例。PS 为句法计划有效性,PAA 为 threat 标签准确率,PAC 为计划–答案一致性。ASR/LSR/ORR 越低越好,PS/PAA/PAC 越高越好。free-form 的 PAC、PS 列分别是抽取出的 action consistency 与 stable extractability。
- 统计与评审:3B 的 FAITHGATE 用种子 42、123、456,报告均值±标准差;除非另有说明,其余对比为单种子。附录 F 对加权和基线做单侧 t 检验。泄露用三级检测器,第 3 级为 0–10 的 LLM judge;论文未在正文写明该 judge 的模型名。行为安全与泄露的具体判定阈值论文未在正文给出完整规则。
- 训练实现:见第 3 问的 3B 超参。1.5B 的 Table 1 为阶段结果,论文未写明该表是否多种子。
主结果
Qwen2.5-3B-Instruct 同协议对比(Table 2)。FAITHGATE 为三种子均值±标准差;比例已换算为百分数。
表格较宽,可左右滑动
方法 ASR↓ LSR↓ ORR↓ PAA↑ PAC↑ PS↑ Base 3B 63.00% 5.30% 1.00% 0 0 0 SFT 3B 26.70% 1.30% 10.00% 56.00% 62.00% 64.00% AnswerOnly 20.50% 0.90% 15.60% — — — Free-form 18.90% 0.88% 9.80% — 68.10% 71.20% WeightSum 24.00% 1.00% 11.00% 58.00% 65.20% 63.30% FAITHGATE 11.55%±1.57% 0.36%±0.29% 1.97%±0.58% 72.19%±1.83% 80.13%±1.42% 82.81%±1.61% - 作者对捷径的解读:answer-only 相对加权和改善了 ASR 与 LSR,但 ORR 升至 15.60%,作者称它仍靠广泛拒答换安全。free-form 改善这一权衡,但抽出的 action consistency 为 68.10%、stable extractability 为 71.20%,都低于 FAITHGATE 的结构化计划指标。
- 相对加权和:作者称 FAITHGATE 六个指标同时更好,大约把 ASR 减半、LSR 减少约三分之二、over-refusal 削减超过 80%,并提高威胁准确率、计划–答案一致性和句法有效性。Figure 3 标注相对加权和:ASR 低 51.9%、LSR 低 64.0%、ORR 低 82.1%,PAA、PAC、PS 分别高 24.5%、22.9%、30.8%。附录 F 称全部报告指标相对加权和有统计显著性。
- 作者的机制说法:若收益只来自更干净的 JSON,应只见 PS 上升而 ASR、ORR、PAC 没有可比改善。作者称最大变化恰在诊断安全捷径的指标上,与“拒答只有配上正确威胁评估才有价值”一致。Table 2 被作者解释为固定结构化接口下的信用分配证据,而不是单模型系统应取代外部审核器。
阶段结果与规模
- 1.5B 阶段(Table 1):Base 的 ASR/LSR/ORR 为 55.67%/6.00%/7.67%,计划指标均为 0。SFT 为 30.79%/3.33%/11.67%,PAA 92.68%、PAC 84.97%、PS 97.92%。RL 为 27.00%/1.67%/11.00%,PAA 92.13%、PAC 86.36%、PS 97.50%。作者称 SFT 是主要表征转变,RL 主要再提高泄露稳健性与 PAC;SFT 提高稳健性的同时也提高 ORR,说明早期安全收益有一部分来自保守拒答。
- 阈值视角(Table 7,仅 1.5B):内部监控目标为 ASR<0.10、LSR<0.03、ORR<0.10、PAA>0.90、PAC>0.85、PS>0.90。Base 只达到 ORR;SFT 达到 PAA 与 PS;RL 达到 LSR、PAC 与 PS,仍未达到 ASR、ORR 与 PAA。
- 4B/7B 单种子(Table 16):Qwen-3-4B 的 Base ASR/LSR/ORR 为 41.20%/3.10%/0.70%,SFT 为 18.40%/0.90%/6.40%,FAITHGATE 为 8.70%/0.27%/1.30%,PAA/PAC/PS 为 78.10%/84.60%/88.40%。Qwen2.5-7B 的 Base 为 36.80%/2.40%/0.50%,SFT 为 15.10%/0.70%/5.10%,FAITHGATE 为 7.40%/0.20%/1.10%,计划指标为 81.40%/86.90%/90.20%。作者称稳健性与有用性继续改善,并称之为较大骨干上的支持性迁移证据。
消融、压力切片与错误模式
- Schema(Table 14,3B 单种子):Threat-only 的 ASR/LSR/ORR 为 21.80%/0.92%/9.40%,PAA/PAC/PS 为 61.10%/66.40%/70.20%。Threat+action 为 16.40%/0.61%/5.80% 与 67.50%/74.10%/76.80%。Full plan + FAITHGATE 与 Table 2 均值相同。作者称只规划威胁最弱,加上动作有较大帮助,完整计划在整体权衡上最好。
- Held-out stress slice(Table 15):1.5B RL 的 ASR/LSR/ORR 为 31.00%/2.40%/13.50%,PAA/PAC/PS 为 88.00%/82.00%/96.50%。3B 加权和为 28.00%/1.60%/12.00% 与 55.00%/61.00%/60.00%。3B FAITHGATE 为 14.00%/0.60%/3.00% 与 69.00%/77.00%/80.00%。作者把它作为超出原 900 条评测的泛化探针,混合了越狱、改写泄露和无害但贴近安全的提示词。论文未报告该切片的条数。
- 残余失败(Table 3):作者列出威胁误分类(混淆的提示词)、计划–答案不匹配(承诺拒答但答案部分服从)、间接泄露(无精确 canary 但语义上泄露改写)和畸形计划。论文未给这些模式的比例。作者称这些失败正因为中间计划而可见,并建议用该记录做系统级分片,例如“无害被标成 jailbreak”“威胁正确但 PAC 失败”“格式失败”。
其他消融与分析
- 三种子(Table 8):种子 42/123/456 的 ASR 为 11.00%/10.33%/13.33%,LSR 为 0.30%/0.10%/0.67%,ORR 为 1.30%/2.30%/2.30%;PAA 为 74.22%/71.67%/70.67%,PAC 为 80.00%/81.61%/78.78%,PS 为 82.78%/84.44%/81.22%。
- 显著性(Table 9,相对加权和):ASR、LSR、ORR、PAA、PAC、PS 的均值差分别为 −0.1245、−0.0064、−0.0903、+0.1419、+0.1493、+0.1951;单侧 p 值均小于 0.05(ASR、ORR、PAA、PAC、PS 的 p<0.001,LSR 的 p=0.012)。
- 相对变化(Table 11):1.5B 上 Base→SFT 的 ASR/LSR 相对变化为 −44.7%/−44.5%,ORR 为 +52.2%;SFT→RL 为 −12.3%/−49.8%/−5.7%。3B 上 WeightSum→FAITHGATE 为 −51.9%/−64.0%/−82.1%,PAA/PAC/PS 为 +24.5%/+22.9%/+30.8%。
- 绝对变化(Table 12):1.5B Base→SFT 的 ASR/LSR/ORR 绝对差为 −0.2488/−0.0267/+0.0400;SFT→RL 为 −0.0379/−0.0166/−0.0067。3B WeightSum→FAITHGATE 为 −0.1245/−0.0064/−0.0903,计划指标为 +0.1419/+0.1493/+0.1951。
- 门控敏感度(Table 24,3B 单种子):(+r, −p, −u) 中 (+2.0, −0.50, −2.0) 的 ASR/LSR/ORR 为 11.55%/0.36%/1.97%,与 Table 2 均值相同。较弱的 (+1.0, −0.25, −1.0) 为 24.60%/0.98%/6.80%,接近加权和的 ASR 24.00%。(+3.0, −0.50, −3.0) 为 12.80%/0.48%/2.40%,高于 (+2.0, −0.50, −2.0)。
- 训练曲线(Figure 4):作者称 3B FAITHGATE 的逐步奖励因离散门控与组内归一化而噪声大,但损失保持有界、奖励 EMA 稳定而非崩溃;这些曲线是优化诊断,不是安全效力的主要证据。
有什么可以进一步探索的点?
作者把多轮训练评测、语义泄露监督和更丰富威胁分类列为后续工作。
作者指出的局限与后续方向
- 实验范围(Limitations):作者写明实验集中于单轮提示词攻击、用于计划正确性与安全打分的轻量验证器,以及主受控研究中的小型开源模型。
- 验证器不是语义证明(Limitations):验证器足以塑造学习,但不是语义安全证明,并继承基准标签和 judge 提示词的一些假设。作者把 AUDIT PLAN 视为纵深防御中的一层,而不是外部防护的替代或语义安全的证明。
- 未覆盖的失败模式(Limitations):多轮对手、工具介导的 prompt injection、judge 模型的分布偏移,以及更广的对抗规模效应,可能引入额外失败模式。
- 忠实性的含义(Limitations):作者不声称隐藏计划在机制意义上保证忠实,只称显式奖励忠实性提高了计划与答案之间可测量的耦合。多轮训练与评测仍是重要后续工作。
- 评审一致性(附录 E):绝对 ASR/LSR 仍可能随 judge 选择变化,跨 judge 一致性与人工审计仍是后续工作。
- 错误模式指向的方向(附录 I):作者称类别 1(混淆提示词上的威胁混淆)和类别 4(间接或改写泄露)仍然最难,并据此提出两个自然方向:更丰富的威胁分类,以及更好的语义泄露监督。
实验覆盖范围
- 被测模型:阶段与奖励消融为 Qwen2.5-1.5B-Instruct 与 Qwen2.5-3B-Instruct;附录 G 的单种子确认为 Qwen-3-4B-Instruct 与 Qwen2.5-7B-Instruct(Table 16)。
- 主评测:留出 900 条,越狱、泄露、无害各 300;SFT 1500 条、RL 1000 条(第 5 节、Table 4)。攻击形态包括直接请求、roleplay、authority framing、hypothetical、comparison、间接泄露模板和合成后缀。
- 同协议对照:answer-only RL、free-form rationale-then-answer、结构化加权和,以及 threat-only、threat+action、完整计划的 schema 消融(Table 2、Table 14)。另有 3B 门控系数的单种子扫描(Table 24)和混合的 held-out stress slice(Table 15)。
- 统计:仅 3B FAITHGATE 报告三随机种子及相对加权和的单侧 t 检验(附录 F)。论文写明 answer-only、schema 与规模确认除非另有说明均为单种子。
- 论文未报告的项目:正文未给出第 3 级 LLM judge 的模型名称;Table 15 未给出 stress slice 条数;Table 3 的残余失败模式未给比例。外部 moderator 的已发表数字被作者放在附录 L.1,并写明因骨干、分类体系与评测协议不同,不与 Table 1、Table 2 做同协议对比。
总结一下论文的主要内容
先承诺可机检安全计划,再让计划正确性决定能否拿到答案奖励。
AUDIT PLAN 把安全对齐从“只优化最终答案”改成“先提交隐藏的结构化安全计划,再按该计划作答”,并用 FAITHGATE 把高答案奖励限定在计划正确时。
- 问题:单轮 prompt-only 对手可诱导越狱或不安全服从,以及泄露 system-prompt 片段或 canary。只看答案时,广泛拒答和事后补一句安全说辞都能提高安全指标,却分不清模型是否识别了威胁。外部 guard 把决策移出生成器,并带来延迟与不一致。
- 方法:同一模型输出含 threat、action、constraints 和可选 trust_boundary 的紧凑 JSON,再输出答案;计划可对用户隐藏并内部记录。SFT 学习该接口,GRPO 再用四个轻量验证器(格式、威胁标签、动作、计划–答案一致性)和五个归一化奖励细化。FAITHGATE 对正确计划加安全答案给 +2.0,对安全但计划错误给 −0.5,对正确计划加不安全答案给 −2.0。
- 3B 主结果(Table 2,三种子):相对同设置加权和,FAITHGATE 的 ASR 从 24.00% 到 11.55%±1.57%,LSR 从 1.00% 到 0.36%±0.29%,ORR 从 11.00% 到 1.97%±0.58%,PAA/PAC/PS 升至 72.19%/80.13%/82.81%。Answer-only 的 ORR 为 15.60%,高于加权和的 11.00%。
- 其他设置:1.5B 上 SFT 把 ASR 从 55.67% 降到 30.79%,ORR 从 7.67% 升到 11.67%;随后 RL 的 ASR/LSR/ORR 为 27.00%/1.67%/11.00%(Table 1)。4B 与 7B 的单种子 FAITHGATE 分别把 ASR 降到 8.70% 与 7.40%、ORR 降到 1.30% 与 1.10%(Table 16)。
- 作者的结论:显式的中间安全承诺是构建更可诊断语言模型的一个实用方向。作者同时把该方法视为纵深防御中的一层:验证器不是语义安全证明,多轮与工具介导攻击不在所声称的范围内。