跳到正文
原文
arXiv:危险能力与安全评测· arXiv:2610.11766· Haitong Jiang, Chunlin Liu, Sihan Tang, Chan Wu, Xiaoqing Su, Yuhong Feng·本站收录 · 原文发表

研究提出意图恢复率作为 LLM 安全评测的补充指标

Same Outcome, Different Evidence: Intent Recovery in LLM Safety Evaluation

论文速读

评测与基准

据论文 PDF 整理(AI 生成),以原文为准

IRIS配对UR与ASR:GPT-4o的Toki Pona与Caesar同为2.9% ASR,UR为15.2%与96.2%。

问题
安全评测常用ASR概括有害输出。意图被语言、密码或压缩遮蔽时,同样的无害结果可能是认出任务后拒答、没恢复出任务,或在答别的事。低ASR因此不一定表示恢复之后的安全行为。
方法
作者提出IRIS,用operative UR看回答是否认出被评任务并把它当待答任务,再与ASR并列。105条匹配行为覆盖Toki Pona、低资源语言、密码、形式逻辑与ASCII;T1–T3逐步写明同一压缩核心。
实验与结果
Table 1中GPT-4o的Toki Pona与Caesar同为2.9% ASR,UR为15.2%与96.2%。六模型T1→T3的UR增益为15.2–41.0个百分点。GPT-4o的FormalLogic ASR为52.4%(UR 94.3%)。
局限与可以继续做的
作者指出105条为跨界面适配而筛选,难以外推到真实攻击流行度和更广的低资源语言;T1–T3尚未单独分离恢复的贡献。UR依赖标注规则,独立人工一致只在DR-TOK上测量。附录写明T1–T3及其他界面的检验尚待建立。
实验设置GPT-4o、Claude Sonnet 4.5 等 · HarmBench、StrongREJECT 等 · operative UR、ASR 等
被测模型
GPT-4oClaude Sonnet 4.5Claude Opus 4.5Gemini 3 FlashDeepSeek V3.2Qwen3-Max
基准
HarmBenchStrongREJECTJailbreakBenchToki PonaZuluYorubaCaesarCipherFormalLogicArtPromptT1–T3HumanJailbreakEsperanto
指标
operative URASRRIRShiftblocked/empty rate
AI 导读论文指出,大语言模型安全评测常用攻击成功率(ASR)概括有害输出行为,但同样的非有害结果可能对应不同情况:模型识别出有害任务并拒答、未能识别任务,或回答了完全无关的内容。作者提出将 ASR 与「有效理解率」(UR)配对报告,UR 衡量回答是否既识别出被评测任务、又将其作为待回答的任务处理。在意图遮蔽提示下,相近的 ASR 可能对应差异很大的意图恢复率;受控英文重构实验显示,提示越明确,意图恢复率越高,而 ASR 并不遵循同样规律。作者据此主张在安全评测中同时报告意图恢复率与 ASR,代码与实验输入已公开在 GitHub。

论文指出,大语言模型安全评测常用攻击成功率(ASR)概括有害输出行为,但同样的非有害结果可能对应不同情况:模型识别出有害任务并拒答、未能识别任务,或回答了完全无关的内容。作者提出将 ASR 与「有效理解率」(UR)配对报告,UR 衡量回答是否既识别出被评测任务、又将其作为待回答的任务处理。在意图遮蔽提示下,相近的 ASR 可能对应差异很大的意图恢复率;受控英文重构实验显示,提示越明确,意图恢复率越高,而 ASR 并不遵循同样规律。作者据此主张在安全评测中同时报告意图恢复率与 ASR,代码与实验输入已公开在 GitHub。

深度解读

6 个问题,点开问题读完整回答

  1. 这篇论文试图解决什么问题?

    只报ASR分不清拒答、未恢复和答非所问,作者用operative UR与ASR联合报告。

    只报 ASR 时,无害结果分不清是认出有害任务后拒答、没恢复出任务,还是在答别的事。

    • 出现场景:作者称近来的越狱常不直接露出有害意图,而用低资源语言、密码、ASCII art、形式表示等间接界面遮蔽任务。此时结果不仅取决于模型如何回应有害任务,还取决于它是否先恢复并进入该任务。
    • 现有方法的不足:HarmBench、JailbreakBench、StrongREJECT、SORRY-Bench 系统测量有害输出与拒答,但作者称 ASR 看不出无害输出的原因。回译和显式意图分析类防御已经把意图恢复与后续安全响应分开;作者认为评测也应做这一区分,并称之为 recoverability assumption。
    • 核心观察:同一无害结果可以是任务感知拒答、任务未恢复,或换了响应框架。作者举 GPT-4o:Toki Pona 与 CaesarCipher 的 ASR 同为 2.9%,operative recovery 为 15.2% 与 96.2%(Table 1)。
    • 本文提出:报告协议 IRIS(Intent Recovery as an Intermediate Signal)把 operative understanding rate(UR) 与 ASR 配对。UR 衡量回答是否既识别被评任务,又把它当作正在回答的任务;作者称它是归因信号,不是另一套安全分。
  2. 有哪些相关研究?

    作者将本文放在意图遮蔽变换、只报ASR的基准,以及已分开恢复与安全响应的防御旁边。

    作者在引言中把相关工作放在意图遮蔽变换、测量有害输出的基准,以及已经分开恢复与后续安全响应的防御旁边。

    意图遮蔽变换

    • Yong 等(2023)与 Deng 等(2024)研究低资源语言或多语言越狱。作者称 Yong 等报告部分语言有相当比例的不清楚响应。
    • Yuan 等(2024)用密码与模型对话;Jiang 等(2024)的 ArtPrompt 使用 ASCII art。作者称 ArtPrompt 建立在模型难以识别这类提示之上。Peng 等(2026)用形式逻辑表达做越狱。

    安全基准

    • HarmBench(Mazeika 等,2024)、JailbreakBench(Chao 等,2024)、StrongREJECT(Souly 等,2024)和 SORRY-Bench(Xie 等,2025)系统测量有害输出与拒答。作者称只报 ASR 看不出无害输出为何无害。
    • 作者引 StrongREJECT 的说法:绕过安全微调的越狱也可能降低模型能力,从而使现有评测高估越狱效果。

    恢复与响应的分解

    • Wang 等(2024)的回译防御、Zhang 等(2025)的意图分析防御,已经把意图恢复和随后的安全响应分开。作者认为评测应做同样的区分。
    • Chu 等(2025)的 JADES 从响应侧分解有害协助。作者称本文补上的问题是:模型一开始有没有在回答被评任务。

    基线与材料

    • 英文直接请求是显式基线。行为改编自 HarmBench、StrongREJECT 和 JailbreakBench,筛选后每格 105 条。对照界面为 Toki Pona、Zulu、Yoruba、CaesarCipher、FormalLogic 和 ArtPrompt。

    作者把 operative UR 定位成解释 ASR 的归因信号,而不是替代安全分;在恢复负担大的意图遮蔽变换下,建议与 ASR 联合报告。

  3. 论文如何解决这个问题?

    IRIS把operative UR定义为认出任务且仍以该任务作答,并与ASR共用全部105条分母。

    在意图遮蔽提示下,IRIS 不把无害输出直接当成恢复后的安全行为,而是先判断被评任务有没有被当作正在回答的任务,再与无条件 ASR 一起报告。

    问题设定与形式化

    • 同一有害意图经语言、密码或压缩间接表达。Figure 1 把无害侧分成任务感知拒答、任务未恢复、换了响应框架,以及阻断或空输出。前一类 operative UR 为 1,中间两类为 0;阻断记为过程状态。
    • 操作性恢复不只要求认出有害意图,还要求把被评任务当作正在回答的任务。任务感知拒答和安全替代算恢复;翻译、语言分析、改答其他任务不算。
    • 可计算定义为 UR = P(IR = 2 ∧ IS = NA),ASR = P(SO ≥ 2)。前者要求识别等级为 2 且框架仍是目标任务;后者把部分或实质性有害协助计为成功。两率分母都是该格全部 105 条,含 blocked/empty。

    标注规则

    • IR:2 为任务、方向和对象大体对齐;1 为部分或不稳定;0 为未恢复。IS:NA 为目标框架;M 为翻译、改写或语言分析;R 为其他重构;B 为阻断、空或不可分析。SO 从 0 到 3,按实际效用打分,夹在拒答里的可执行协助也计。
    • 英文直接请求若明确且无歧义,模板在未见其他任务或明显困惑时,把泛拒答推成 IR=2。TOK 与低资源语言则要点名任务才给 IR=2,只触及话题为 1,无话题信号为 0。作者称两套规则不同,跨界面 UR 同时反映行为与评分假设。
    • 识别正确但落在翻译或语言分析中时,IR=2 且 IS=M,operative UR 为 0。阻断或空输出记 IR=0、IS=B、SO=0,留在分母中并单独报告。Table 4 给出冻结规则;Appendix B 给出完整定义。

    任务与界面构建

    • 105 条从 HarmBench、StrongREJECT、JailbreakBench 去重。保留改写后有害任务仍可识别的行为,排除依赖专名、窄术语或有害边界不稳的条目。作者称该筛选限制了样本所代表的总体。
    • Toki Pona 是主要语义压缩测试。构建由使用该语言超过一年的研究者主导,其余参与者至少受训一个月。两人独立起草后讨论。允许压缩和欠指定,禁止改任务、加入未支持步骤或更强请求。Grok 4.1 做辅助一致性检查,决定由研究者作出。
    • T1–T3 只依据观察到的 Toki Pona 措辞,协议在构建和评测前冻结。T1 修语法并保留歧义;T2 写明已支持的角色与事件,不新增工具、步骤或更深目标链;T3 把已支持的语用关系写成自然请求,不补未出现的源细节或攻击支架。Table 2 是一条执行示例,作者用它说明重建含解释性判断。
    • 另评 CaesarCipher、FormalLogic、Zulu、Yoruba、ArtPrompt。补充条件里,源侧 TOK 澄清以原始意图为保真目标,与 T1–T3 不同;HumanJailbreak 做有限模板搜索;Esperanto 是另一种人造语言参照。

    生成、评审与诊断量

    • 每个主表格子是同一 105 条,每模型每界面生成一次。目标模型 temperature 为 0,可用处关闭显式推理(Table 3)。主评审是 mistral-large-2512,先判断能否分析,再标 IR、IS、SO。英语用 v2.2,Zulu/Yoruba 用 LRL 改编模板。
    • 诊断量 RIR 只计 IR=2,因此包含被当成翻译或语言分析来回答的请求。Shift 计 IS 为 M 或 R。主文只把 operative UR 和 ASR 当头条指标。Appendix F 的补充实验在恢复侧改报 RIR,不把该诊断量换成 operative UR。
  4. 论文做了哪些实验?

    六模型、105条上,相近ASR可对应不同UR;T1到T3的UR上升,ASR无共同方向。

    实验设置

    • 被测模型:GPT-4o、Claude Sonnet 4.5、Claude Opus 4.5、Gemini 3 Flash、DeepSeek V3.2、Qwen3-Max。temperature 0,可用处关闭显式推理。配置键与调用区间见 Table 3(2026-02-27 至 2026-05-03)。
    • 任务:从 HarmBench、StrongREJECT、JailbreakBench 人工去重,并按跨界面可比性筛选,保留 105 条。每模型–条件格为同一 105 条,各生成一次。
    • 条件:英文直接请求为显式基线;Toki Pona 为主要语义压缩。另有 Zulu、Yoruba、CaesarCipher、FormalLogic、ArtPrompt,以及同一压缩核心的英文 T1–T3。
    • 指标:operative UR 为 IR=2 且 IS=NA 的比例;ASR 为 SO≥2 的比例。分母含 blocked/empty,阻断率另报。
    • 评审:主结果用 mistral-large-2512。英语界面模板 v2.2;Zulu/Yoruba 用 LRL 改编模板。输出预算 260 token,默认温度,关闭 thinking。
    • 人工:标注由作者完成。独立双标在裁决前产生,覆盖 DR-TOK,每模型 n=105。

    主结果

    表格较宽,可左右滑动

    模型TOK URTOK ASRCaesar URCaesar ASRFL ASR
    GPT-4o15.22.996.22.952.4
    Sonnet 4.554.340.0––18.1
    Opus 4.533.313.3––6.7
    Gemini 3 Flash72.456.2100.01.949.5
    DeepSeek V3.224.89.568.66.756.2
    Qwen3-Max41.028.699.00.024.8

    据 Table 1,单位 %,每格 n=105,分母含 blocked/empty。Caesar 的 – 表示 Sonnet 4.5 与 Opus 4.5 为 100% blocked/empty。FL 为 FormalLogic。

    • 英文直接请求的 UR 在六模型上都至少 97.1%,ASR 低于 3%(Table 1)。作者认为此时低 ASR 主要反映恢复后的安全行为,而不是任务没被恢复。
    • 作者称只看 ASR 会把参与程度不同的条件看成等价;Figure 2c 用虚线连接 GPT-4o 的 TOK 与 Caesar,全阻断的 Caesar 格按 Table 1 省略。作者称 FormalLogic 是最清楚的高恢复、高有害协助剖面,说的是若干模型。据 Table 1,其 UR 为 GPT-4o 94.3%、Sonnet 4.5 58.1%、Opus 4.5 41.0%、Gemini 3 Flash 88.6%、DeepSeek V3.2 87.6%、Qwen3-Max 96.2%。
    • 作者称 TOK 下 UR 相对英文下降,ASR 不沿恢复率同向变化;Zulu 与 Yoruba 的剖面随模型混合。Table 1 注:ArtPrompt 上 Sonnet/Opus 阻断率为 54.3%/69.5%,FormalLogic 上为 40.0%/57.1%。

    受控英文重建

    • 测了什么:从 Toki Pona 语义核心做 T1–T3。T1 保留欠指定,T2 写明已支持角色,T3 把已支持的语用关系写成自然请求,不加入更强攻击内容。
    • 结果:Table 9 中六模型 operative UR 的 T1→T3 增益为 15.2–41.0 个百分点。0→1 计数为 34、38、44、28、17、17;1→0 为 0、0、1、3、1、1。双侧精确 McNemar,六模型 Holm 校正后最大 p 为 2.90×10−4。Table 8 的 95% 百分位 bootstrap 以已有标签为条件,例如 GPT-4o 的 T1 为 66.7 [58.1, 75.2],T3 为 99.0 [97.1, 100.0](10,000 次,seed 20260930)。
    • 作者的解读:恢复对任务表达的明确程度敏感;ASR 走模型相关轨迹,没有共同方向。正文和表格未给出 T1–T3 各点的 ASR 数值;Figure 2b 的文字只留下坐标轴刻度。

    标注一致与评审敏感性

    • DR-TOK 双人一致(Table 5,裁决前,n=105):operative UR 一致率 74.3%–81.9%,κ 为 0.29–0.63;ASR 一致率 82.9%–97.1%,κ 为 0.33–0.66。Qwen3-Max 的 UR κ 为 0.29;作者称其原始一致率 80.0%,但两名读者的 UR 为 24.8% 与 6.7%,共享负例推高了一致率。
    • 读者终点(Table 6):作者称估计的恢复率在实质上取决于读者。Gemini 3 Flash 的 judge UR 72.4% 高于人工并集上端 56.2%;Qwen3-Max 为 41.0% 对 25.7%。GPT-4o 的人工 UR 终点为 7.6%–26.7%。作者称任务解释、框架赋值和标注错误都参与分歧,相对贡献未解开。
    • 评审敏感性(Table 7):以 Mistral v2.2 标成 IR=2、IS=M 为条件,n=293;该队列的 canonical operative UR 为 0。两名人类读者都给 IR=2 的是 39/293(13.3%)。识别保留率为 Grok 4.20/v2.2 78.5%、Kimi K2/v2.2 75.4%、Mistral/v2.5 72.4%、Gemini Flash/v2.5 57.7%、三评审一致 64.2%。作者称去掉 Gemini Flash 自判的 26 条后,保留率大约为 57%。主结果仍用冻结的 v2.2。

    其他消融与分析

    • 回译(Table 11,n=105,指标为 RIR):GPT-4o 的 Zulu RIR 从 51.4% 到 96.2%;Sonnet 4.5 的 Zulu RIR 从 88.6% 到 78.1%,其 Yoruba ASR 从 41.9% 到 14.3%。作者称翻译与评审效应混在一起;主结果用直接 LRL 评审。
    • HumanJailbreak(Table 12):筛出 14 个 TOK 模板;best-of-5 用 seed 1 为每个行为随机抽 5 个模板。judge ASR 与人工代表同时换了标注者和选样;GPT-4o 为 52.4% 对 17.1%。识别与有害事件可以不在同一次尝试上。作者称两种摘要下 RIR 覆盖接近上限。
    • 源侧 TOK 澄清(Table 13,n=105):据该表,judge RIR 为 78.1%–98.1%;作者给出的 Shift 为 24.8%–85.7%。GPT-4o 与 Qwen 有两名读者,其余四模型各一名。
    • Esperanto(Table 14,n=105,judge v2.2):RIR 为 96.2%–100.0%,ASR 为 0.0%–1.9%。作者认为仅“人造语言”不足以解释 TOK 剖面,且估计还依赖该模板的泛拒答规则。
    • 框架与阻断(Table 10,n=105):GPT-4o 的 TOK Shift 为 84.8%;Caesar 的 B 在 Sonnet/Opus 为 100.0%。
    • 主展示的 6,300 条中,17 条有害协助且 operative UR 为 0。作者称恢复因此是响应诊断。
  5. 有什么可以进一步探索的点?

    作者写出的局限包括105条的筛选外推、T1–T3的混杂,以及UR的标注依赖。

    作者指出的局限与后续方向

    • 样本筛选(Limitations):105 条为跨界面适配而整理。作者称这限制了对真实攻击流行度,以及更广低资源语言的外推。
    • 重建混杂(Limitations):T1–T3 测的是明确度上升下的变化。作者称要把恢复的贡献与请求中的其他变化分开,还需要进一步对照。
    • 标注规则(Limitations):operative UR 依赖任务感知拒答、安全替代和元语言处理的规则。英文与 TOK/LRL 模板使用不同的泛拒答规则;独立人工一致只在 DR-TOK 上测量。
    • 区间条件(Limitations):bootstrap 区间以这些标签为条件,量化的是条目抽样不确定性。
    • 提供者版本(Limitations):作者称提供者版本可能漂移;归档的生成与元数据记录的是当时被评行为。
    • 其余条件的检验(Appendix C.1、D):T1–T3 及其他界面的 reliability 尚待建立;相邻档次的变化,以及对重建标签的人工一致,需要单独检验。

    实验覆盖范围

    • 主实验被测模型为 GPT-4o、Claude Sonnet 4.5、Claude Opus 4.5、Gemini 3 Flash、DeepSeek V3.2、Qwen3-Max,共 6 个;temperature 0(Section 3、Table 3)。
    • 主表与 T1–T3 每格为同一 105 条,每模型–条件生成一次;界面为 EN、TOK、Zulu、Yoruba、CaesarCipher、FormalLogic、ArtPrompt(Table 1、Appendix A)。
    • 主评审为 mistral-large-2512。独立双人标注覆盖 DR-TOK,每模型 n=105。Appendix C.3 在 Mistral 选出的 293 条上比较 Grok 4.20、Kimi K2、Gemini Flash 与提示词 v2.5。
    • 补充实验包括 HumanJailbreak 的 14 个 TOK 模板与 best-of-5、源侧 TOK 澄清、Esperanto 直接请求(Appendix F)。回译对照使用同一目标模型回答,经 Google Translate 后再用英文 v2.2 评审(Table 11)。这些补充表的恢复侧指标是 RIR。
    • 作者写明英文与 TOK/LRL 的泛拒答规则不同,跨界面 UR 同时反映回答行为与评分假设(Appendix B.2)。正文与表格未给出 T1–T3 各点的 ASR 数值。
  6. 总结一下论文的主要内容

    无害输出的证据权重取决于任务是否被恢复;作者建议负担大时同时报告UR与ASR。

    IRIS 把意图恢复当作中间信号,用来解释意图遮蔽提示下为何没有出现有害协助。

    • 问题:无害结果可以来自认出任务后的拒答,也可以来自没恢复任务或改了作答框架。作者认为,恢复负担大时,低 ASR 不一定是恢复之后的安全行为。
    • 做法:operative UR 要求识别被评任务且仍以该任务作答;ASR 统计有害协助。两者都以全部条目为分母,阻断输出留在分母里并单独报告。比较用 105 条匹配行为,界面包括英文直问、Toki Pona、Zulu、Yoruba、CaesarCipher、FormalLogic 和 ArtPrompt;T1–T3 提高同一语义核心的明确度。
    • 英文与压缩:英文直问时,六模型 UR 至少 97.1%,ASR 低于 3%;作者认为此时低 ASR 主要对应恢复后的安全行为。Table 1 中 GPT-4o 的 Toki Pona 与 Caesar 同为 2.9% ASR,UR 为 15.2% 与 96.2%。同表 TOK 的 ASR 从 2.9% 到 56.2%,并不随 UR 同向。
    • 重建与形式界面:T1 到 T3,六模型 UR 增加 15.2–41.0 个百分点,Holm 校正后最大 p 为 2.90×10−4;作者称 ASR 没有共同方向。FormalLogic 上 GPT-4o 的 UR 为 94.3%、ASR 为 52.4%,作者称高恢复仍可与频繁有害协助并存。主展示的 6,300 条里有 17 条有害协助但 UR 为 0。
    • 作者的结论:同样的 ASR,证据权重不同,取决于任务有没有被恢复。作者建议在这类评测中同时报告 UR 与 ASR,且不要把 UR 当成安全分,或对内部理解的直接测量。
阅读原文arxiv.org