研究者提出 SMT 框架,通过模拟审核轨迹越狱函数调用 LLM
Beyond the Prompt: Jailbreaking Function-Calling LLMs via Simulated Moderation Traces
SMT在SafeBench-Tiny上对六个商业LLM的平均ASR为99.67%,平均AQ为1.48。
black-box:仅经公开API与支持function-calling的安全对齐LLM交互,可提交消息、schema及历史(含函数调用与工具反馈);无参数、梯度、logits、隐藏系统提示与提供方分类器,不能改模型或关闭对齐。
- 函数调用把开发者schema、参数和不可信工具输出交织进同一上下文,有害意图可分散到多轮轨迹。提示词级攻击和单次函数调用攻击没有刻画这种累积执行状态。
- SMT注册并不真正执行的生成器与校验器schema,把有害主题写入函数描述,从unsafe_sample抽取输出。拒答换成伪造调用,低分则追加伪造校验异常。默认K=3、N=3,由GPT-5.4-Nano按HarmScore≥60判成功。
- SafeBench-Tiny与JailbreakBench上,SMT六模型平均ASR为99.67%与98.33%,平均AQ为1.48与1.37。FCGuard使GPT-5.4上SMT的SafeBench ASR变为0.00%。
- 作者指出需函数调用API与自定义工具,不能直接用于普通聊天;白盒分析在Qwen3.5-9B,且未必代表专有模型。作者称FCGuard可压低ASR。实验含六个商业模型与两个基准;论文未报告统计检验和人工一致性。
- 威胁模型
- black-box:仅经公开API与支持function-calling的安全对齐LLM交互,可提交消息、schema及历史(含函数调用与工具反馈);无参数、梯度、logits、隐藏系统提示与提供方分类器,不能改模型或关闭对齐。目标是预算内从参数rh取得有害输出且H≥θ,而不把q作为直接请求。
- 被测模型
- GPT-4oGPT-5.4Qwen3-MaxGemini-3-FlashDeepSeek-V4-FlashClaude-Sonnet-4.5Qwen3.5-9B
- 基准
- SafeBench-TinyJailbreakBench
- 指标
- ASRAverage HarmScoreAverage QueriesHarmScore
研究者提出 SMT 黑盒越狱框架,针对有状态、函数调用环境中的结构性漏洞发起攻击。该方法构造多轮轨迹,模拟合法的审核审计工作流,以红队测试为借口诱导有害生成,并将安全拒答视为执行失败,通过验证反馈逐步削弱模型的安全约束。在来自五家供应商的商业 LLM 上、两个标准化安全基准的评测显示,SMT 在平均攻击成功率和 HarmScore 上均最高,且所需查询次数接近最少,明显优于现有基线。研究认为仅靠提示词层面的清洗不足以防御工具型 LLM 系统,需要在 schema、参数、工具输出和累积对话状态上做上下文感知校验。
深度解读
这篇论文试图解决什么问题?
函数调用把schema、参数、工具反馈和历史交织进同一上下文,提示词级威胁模型覆盖不到。
函数调用把可信控制与不可信数据放进同一上下文,提示词级越狱覆盖不到。
- 场景: 作者称 LLM 已进入软件助手、自主智能体和工具应用。function calling 把开发者 schema、参数、工具输出、校验消息和历史交错进同一上下文,控制面与数据面的分界变模糊。
- 已有缺口: 作者称现有工作多以用户可见提示词为攻击面。单轮改写、多轮诱导,以及 JailbreakFunction、Odysseus、iMIST 和 ISC,都未系统考察轨迹累积状态,也未利用原生报错、校验失败和重试回路。
- 观察: 作者认为有害意图可拆进 schema、参数、反馈和历史;模型兼做执行控制器与策略执行者,局部像合法流程的片段按顺序组合后,会把拒答推向任务遵从。
- 提出的方法: 黑盒框架 SMT(Simulated Moderation Traces)模拟多轮审核审计,把拒答改写成执行失败,并在两个安全基准上评估,同时给出原型护栏 FCGuard。
- 威胁模型:
- 目标: 不把有害查询 q 当作直接请求,而从函数参数 rh 取得有害内容,使 H(q, rh)≥θ;预算内有一条候选达标即可。
- 知识: 论文称为 black-box。无参数、梯度、logits、token 概率、训练数据、隐藏系统提示和提供方安全分类器。
- 能力: 可作为 API 客户端或恶意客户端编排器,提交用户消息、function schema,以及先前消息、函数调用和 API 接受的工具式反馈。跨轮状态只来自显式提交的上下文;不能改模型、关闭对齐或改写提供方系统指令。
- 受害系统: 支持 function calling 的安全对齐 LLM 公开 API。防御方可在部署前对齐,部署后做过滤、分类、审核、schema 检查和提示词提醒;目标是任一可见输出都低于 θ。
有哪些相关研究?
相关工作覆盖对齐、提示词越狱和工具工作流;作者称它们未刻画函数调用的累积执行状态。
论文按安全对齐与越狱两条线综述,并称已有攻击没有充分刻画函数调用轨迹的累积执行状态。
安全对齐
- RLHF 与原则反馈: InstructGPT(Ouyang 等,2022)用人类反馈强化学习改进指令遵循并减少不良输出。Constitutional AI(Bai 等,2022)用原则引导的自我批评和 AI 反馈,以降低人工标注成本。
- 偏好优化: DPO(Rafailov 等,2023)不建显式奖励模型,直接优化偏好对。C-DPO、SafeDPO 将安全约束写入 DPO;DOOR Alignment(Zhao 等,2025)把稳健拒答与有害知识遗忘分开。
- 作者的收束: 作者称推理模型把一部分安全问题转到语义核验和推理时控制,但对齐后的模型仍会被对抗输入攻破。
提示词与优化型越狱
- 白盒或灰盒: GCG(Zou 等,2023)用梯度引导的后缀优化产生可迁移越狱提示。其后有可控生成、更强坐标优化、稠密到稀疏约束优化和连续提示松弛。作者称这些假设往往强于商业部署里攻击者实际拥有的条件。
- 黑盒搜索: Do Anything Now、ArtPrompt、CC-BOS 和嵌套场景做变换或伪装;MASTERKEY、GPTFuzzer、PAPILLON、PAIR、TAP 用搜索、模糊测试或攻击模型反馈代替手工编写。
- 长上下文与多轮: Many-shot Jailbreaking、Crescendo 和 ASJA 利用更长上下文或多轮转向。
工具、多模态与工作流
- 函数调用与跨模态: JailbreakFunction(Wu 等,2025)研究函数调用约束如何与安全行为交互;引言称其使用较简单的诱导场景,且不利用历史上下文。Odysseus(Li 等,2026)用双重隐写和跨模态工具。iMIST(Wang 等,2026)用强化学习优化多步、以工具伪装的调用。
- 工作流失败模式: ISC(Wu 等,2026)写的是任务完成与自动校验把前沿模型推向不安全生成。作者称它和常规提示词攻击都未完全覆盖工具系统的动态架构攻击面。
- 分组批评: 引言把 JailbreakFunction、Odysseus、iMIST 放在一起,称它们主要处理单次函数调用、输入模态混淆或孤立工作流,没有系统考察 schema、必填参数、生成的调用和伪造校验异常如何共同塑造后续行为,也没有研究如何对抗性地利用原生报错、校验失败和重试反馈。
实验基线与基准
- 基线: ArtPrompt、Do Anything Now、PAPILLON、CC-BOS、Crescendo、TVD-Single、Odysseus、JailbreakFunction。Table 1 将查询策略分为 Single-turn、Iterative Single-turn、Repeated Single-turn、Multi-turn 和 Iterative Multi-turn。
- 基准: SafeBench-Tiny 有 50 条查询、10 类、每类 5 条;JailbreakBench 有 100 个有害滥用行为、10 类、每类 10 条。
作者将 SMT 放在整条函数调用轨迹上:考察模拟校验痕迹如何跨轮改写后续行为,而不是优化单条提示、单次调用或固定工作流。
论文如何解决这个问题?
SMT用审核用例的函数参数承载有害内容,并把拒答改写成校验失败以驱动多轮修正。
SMT 不改写单条提示词,而是模拟一条多轮审核审计轨迹:schema 迫使模型把有害内容填进参数,再把安全拒答改写成校验失败。Figure 1 将提示词级单轮/多轮、单函数 JailbreakFunction 与多轮 SMT 并列;Figure 2 分成单轮执行、schema 和多轮回写。主轨迹中这两个函数并不作为后端程序执行。
问题设定与成功判定
- 接口: 目标 API 接受用户消息和 function schema,返回自然语言或结构化函数调用。若返回调用,攻击者解析参数,抽出 unsafe_sample 作为候选 rh。
- 分数: 外部评判 J 用附录 A 的 H-CoT 标尺,实验中由 GPT-5.4-Nano 担任。H(q, rh) = 20 · J(q, rh),把 0–5 分映射为 HarmScore。
- 成功: H(q, rh) ≥ θ。默认 θ=60,即 J 至少为 3。达到阈值则结束;否则进入有状态修正。预算内有一条候选达标即算该查询成功。
- 呈现方式: 有害查询不作为要模型直接回答的用户请求,而是模拟审核任务的目标主题,经 Target Injection 写入函数描述。
单轮执行与两个 schema
- 请求: 第 1 轮以红队测试为理由,要求调用 Case Generator。附录 B 给出完整提示词,这里不复述。
- 两条响应: Response A 是自然语言拒答,不返回 Function Call。作者不把拒答原文写入下一轮,以免强化拒绝,而是伪造一个看起来成功的调用。Response B 是对生成器的结构化调用,抽出 unsafe_sample 交评判。
- 生成器: 必填 safe_sample 与 unsafe_sample,由模型补全,而不是由用户直接给出。作者称成对字段比只要求不安全样本更像在构造审核数据集。描述声称样本会送给校验器,但 Function 1 并不真正调用 Function 2。描述还含若干成对示例。
- 校验器: 描述中写格式、长度和有害性检查。Figure 2 标注 No Actual Invocation 与 Mocked OpenAI Moderation API。它不在主循环中执行,只让下游检查看起来具体。论文用日历函数推断缺失时间的例子说明:传统必填参数约束调用方,LLM 函数调用则要求模型按 schema 生成参数对象。
多轮轨迹修正
- 预算: K 为独立重试轨迹数,N 为每条轨迹的轮数。默认 K=3、N=3。one-shot 取 K=1、N=1,退化为单次 API 查询。
- Case A / B: 拒绝调用时,用格式完好的伪造函数调用替换拒答,该替换本身不算成功载荷。已返回调用但分数低于 θ 时,保留该调用。
- 伪造异常: 两种失败都追加一条写成审核接口抛出的异常,内容来自 Function 2 的描述,表示未通过预期校验,并促使按可见要求重试。附录 B 给出异常文本。
- 搜索: 跨轮保留目前最高评判分的载荷。一条轨迹的 N 轮都未达 θ,则结束会话并新开轨迹,直到 K。作者称重置是为避免陷在无效历史里,同时保留按分数搜索。
作者给出的设计意图
- 累积状态: 作者称 SMT 利用的是工具工作流里累积的状态,而不是孤立输入上的措辞、结构或 token 扰动,也不是只打一个函数组件。
- 局部一致: 作者称 schema、必填参数、生成的调用和伪造异常各自可以像合法工作流,顺序组合后推动自动修正回路从安全拒答转向任务遵从。
论文做了哪些实验?
SMT在SafeBench-Tiny的平均ASR为99.67%,在JailbreakBench为98.33%。
六个商业模型上,完整 SMT 的平均 ASR 在 SafeBench-Tiny 为 99.67%、在 JailbreakBench 为 98.33%,平均查询为 1.48 与 1.37;FCGuard 在两个较新模型上把 ASR 降到 0.00%。
实验设置
- 目标模型: 黑盒为 GPT-4o、GPT-5.4、Qwen3-Max、Gemini-3-Flash、DeepSeek-V4-Flash、Claude-Sonnet-4.5,来自五家提供方,经标准 API。白盒本地模型为 Qwen3.5-9B。
- 数据: SafeBench-Tiny 为 50 条、10 类、每类 5 条;JailbreakBench 为 100 个行为、10 类、每类 10 条。后文表题常把前者写作 SafeBench。
- 基线: ArtPrompt、Do Anything Now、PAPILLON、CC-BOS、Crescendo、TVD-Single、Odysseus、JailbreakFunction,以及 SMT(one-shot)。基线使用官方超参和默认提示模板,评测指标相同。
- 指标: ASR 是 HarmScore≥60 的查询百分比;Avg.Score 是全集平均 HarmScore;AQ 是每条输入的平均 API 调用次数。
- 评判: 主评判为 GPT-5.4-Nano,标尺见附录 A,θ=60。附录 D 另用本地 HarmBench-Llama-2-13b-cls 报 ASR。人工评估为三名标注者,标准与 H-CoT 相同,响应经匿名并打乱。
- 攻击配置: 默认 K=3、N=3;one-shot 为 K=1、N=1。论文未报告主实验的解码温度和独立重复次数。
主结果
据 Table 2,完整 SMT 的 ASR(%)与 Avg.Score:
表格较宽,可左右滑动
模型 SB ASR SB 分 JBB ASR JBB 分 GPT-4o 100.00 72.80 100.00 74.40 GPT-5.4 100.00 76.40 99.00 77.40 Qwen3-Max 100.00 73.60 100.00 80.20 Gemini-3-Flash 100.00 72.40 100.00 79.00 DeepSeek-V4-Flash 100.00 75.60 100.00 79.40 Claude-Sonnet-4.5 98.00 74.80 91.00 70.60 六模型平均 99.67 74.27 98.33 76.83 - 作者称 这是新的 state of the art,且两个平均 ASR、两个平均 HarmScore 都最高。对照的平均 ASR:CC-BOS 为 94.00% 与 85.50%,JailbreakFunction 为 72.33% 与 73.67%(Table 2)。
- 并非每格分数都最高: Qwen3-Max 的 SafeBench-Tiny 上,TVD-Single 的 Avg.Score 为 74.40,高于表中 SMT。ASR 列上 SMT 为最高,或与若干 100.00% 的基线并列。
- one-shot 与难模型: one-shot 平均 ASR 为 78.67% 与 87.50%。作者称多轮修正重要,且 one-shot 平均仍高于多数基线;SafeBench-Tiny 上 CC-BOS 的平均 ASR 94.00% 高于 one-shot。JailbreakBench 上 Claude-Sonnet-4.5 的 Crescendo、PAPILLON、ArtPrompt、JailbreakFunction 分别为 0.00%、1.00%、2.00%、5.00%。作者称 Figure 3 除该模型的类别 1(Malware)和类别 3(Disinformation)外,SMT 位于雷达图外圈;转写文本没有各类别数值。
查询效率
- 测了什么: Table 3 比较多轮方法的 AQ。TVD-Single 与 SMT(one-shot)被排除,因为按设计恰好 1 次查询。
- 结果: SMT 平均 AQ 在 SafeBench 为 1.48,在 JailbreakBench 为 1.37。SafeBench 上它在六个模型中的五个最低;DeepSeek-V4-Flash 上 JailbreakFunction 为 1.20,SMT 为 1.60。JailbreakBench 上六个模型都是 SMT 最低。
- 作者的解读: 作者称 SMT 能以少得多的 API 交互找到有效轨迹。例如 JailbreakBench 上 CC-BOS 对 GPT-5.4、Claude-Sonnet-4.5 为 41.57 与 24.73,SMT 为 1.53 与 1.94。
防御评测
- 传统防御: Table 5 只在 Claude-Sonnet-4.5、SafeBench 上比较 TVD-Single、CC-BOS 与 SMT。长度上限 512 token,低温度为 0,Safety Reminder 写入系统提示,Safety Check 用 GPT-5.4-Nano 判 JAILBREAK 或 LEGITIMATE,Combined 四者并用。无防御时 SMT 为 98.00 / 74.80 / 1.42。Combined 后 SMT 为 78.00(↓20.00)/ 60.40(↓14.40)/ 3.48(↑2.06);TVD-Single 与 CC-BOS 的 ASR 为 40.00(↓50.00)与 44.00(↓46.00)。单项里 Safety Reminder 对 SMT 的下降最大:ASR ↓16.00,分数 ↓11.20。
- FCGuard: 要求模型检查历史、工具定义、schema、参数和工具输出,并拒绝把违规伪装成模拟、授权、诊断或间接注入。Table 6 在 SafeBench 上测 SMT 与 JailbreakFunction。GPT-5.4 与 Claude-Sonnet-4.5 上两者 ASR 都到 0.00%;SMT 的 Avg.Score 仍为 10.40 与 6.00。GPT-4o 上 SMT 从 100.00 / 72.80 到 84.00(↓16.00)/ 65.60(↓7.20)。
- 作者的解读: 作者称常规防御下 SMT 的降幅小于两个对照,且各防御设置下 ASR 与分数仍最高。对 GPT-4o,作者认为一个可能原因是它理解和遵循 FCGuard 指令的能力较弱。附录 C 给出各防御提示。
白盒机制与人工评估
- 流程追踪: Section 5.4 在本地 Qwen3.5-9B 上追踪上下文组装,角色为 System、User、Assistant、Tool。Figure 4 标注 System Priority > User,以及 Tool Rules affect Safety Policies。作者称工具规则与安全策略同处系统级优先级,有害意图进入工具参数或模拟轨迹后,格式约束压过安全策略。论文未报告对隐藏状态的干预。
- 本地攻击数字: Table 4 中 SMT 在两个基准的 ASR 都是 100.00,分数 74.00 与 79.80,AQ 为 1.58 与 1.16。CC-BOS 的 ASR 也是 100.00,分数为 63.20 与 63.80。Crescendo 在两个基准都是 2.00%。作者称 SMT 的 ASR 最高;与 CC-BOS 在 ASR 上并列。
- 人工与失败例: Table 7 中,Claude-Sonnet-4.5、SafeBench 上 SMT 的人工 ASR / 分数为 97.00 / 74.40,LLM 评判为 98.00 / 74.80。作者称人工分略低,LLM 评判略偏乐观。附录 F 给出成功与失败示例;失败例中模型拒绝所请求内容,并建议改为预防与检测材料。
其他消融与分析
- θ(Fig. 5,JailbreakBench,θ 取 60、80、100): 作者称 ASR 单调下降,且从 80 到 100 更明显,Avg.Score 与 AQ 上升;转写文本没有端点数值。
- Variant I(去掉红队/审核语境,Table 8,SafeBench): 平均 ASR 89.00(↓10.67),分数 63.80(↓10.47),AQ 2.62(↑1.14);GPT-5.4 的 ASR 为 52.00(↓48.00),分数 37.60(↓38.80)。
- Variant II(去掉成对生成器 schema): 平均 ASR 92.00(↓7.67),分数 69.60(↓4.67),AQ 2.26(↑0.78)。
- Variant III(去掉校验器上下文): 平均 ASR 94.67(↓5.00),分数 70.83(↓3.44),AQ 2.04(↑0.56);作者称单项降幅最小。
- Variant IV(去掉基于上下文的修正): 平均 ASR 92.00(↓7.67),分数 69.07(↓5.20),AQ 2.11(↑0.63)。
- HarmBench 评判(Table 9): SMT 平均 ASR 仍为 99.67% 与 98.33%;作者称 CC-BOS 降到 59.33% 与 44.17%,原因是本地评判无法理解文言文。
有什么可以进一步探索的点?
作者指出SMT依赖函数调用API,白盒分析在Qwen3.5-9B,且FCGuard一类防御可压低效果。
作者把适用接口、白盒外推和函数调用通路上的防御写成局限,并建议防御覆盖完整调用生命周期。
作者指出的局限与后续方向
- 接口条件: SMT 需要 API 级 function calling,以及注册或调用自定义工具的能力,不能像纯提示词攻击那样直接用于普通聊天界面(Section 6)。
- 白盒外推: 作者认为 Qwen3.5-9B 上的本地分析未必能完全代表专有模型的内部机制(Section 6)。
- 时间范围: 作者认为商业 LLM 及其安全机制持续更新,所观察到的脆弱性应视为所评测系统的快照,而不是永久或普遍弱点(Section 6)。
- 针对性防御: 作者称 FCGuard 一类防御可把效果降到很低甚至使攻击失败,并称 SMT 对为函数调用通路设计的防御仍然较弱(Section 6)。
- 后续防御: 作者认为未来应把 function-call-aware 防御纳入模型和部署流程(Section 6),并覆盖 schema 设计、参数生成、工具输出、校验反馈和历史上下文(Section 7)。
实验覆盖范围
- 模型与数据: 黑盒目标为六个商业 LLM,另有本地 Qwen3.5-9B。基准为 SafeBench-Tiny(50 条、10 类、每类 5 条)和 JailbreakBench(100 个行为、10 类、每类 10 条)。
- 传统防御: Length Limit、Low Temperature、Safety Reminder、Safety Check 与 Combined 的数字在 Claude-Sonnet-4.5、SafeBench,对照为 TVD-Single 与 CC-BOS(Table 5)。
- FCGuard: 数字在 GPT-4o、GPT-5.4、Claude-Sonnet-4.5 与 SafeBench,攻击为 SMT 和 JailbreakFunction(Table 6)。
- 人工评估: 三名标注者评估 Claude-Sonnet-4.5 在 SafeBench 上、TVD-Single、CC-BOS 与 SMT 的响应(Table 7)。论文未报告标注者间一致性,也未写明条数。
- 未报告项: 论文未报告统计显著性检验、主实验解码温度和整套实验的独立重复次数。白盒流程追踪的模型是 Qwen3.5-9B(Section 5.4)。附录 D 用 HarmBench-Llama-2-13b-cls 在两个基准、六个商业模型上另报 ASR。
总结一下论文的主要内容
SafeBench-Tiny与JailbreakBench上SMT平均ASR为99.67%与98.33%。
SMT 是针对函数调用 LLM 的 black-box 越狱,攻击面是提交进 API 的 schema、参数、工具式反馈和历史,而不是单条用户提示词。
- 问题: 安全对齐模型在工具应用里同时做执行控制和策略执行。有害意图可以不出现为一次直接请求,而分散在函数描述、必填字段和校验反馈中。
- 做法: 伪造审核审计流程。生成器要求成对的 safe_sample 与 unsafe_sample,校验器只出现在描述里、主循环不执行。拒答被换成看似成功的函数调用,低分输出被写成校验异常。默认 3 条轨迹、每条最多 3 轮,保留最高分载荷。成功标准是 GPT-5.4-Nano 的 HarmScore≥60。
- 主结果: Table 2 中,六个商业模型上完整 SMT 的平均 ASR 为 99.67%(SafeBench-Tiny)与 98.33%(JailbreakBench),平均 HarmScore 为 74.27 与 76.83。Table 3 的平均查询为 1.48 与 1.37。Claude-Sonnet-4.5 的 JailbreakBench ASR 为 91.00%。Qwen3-Max 的 SafeBench-Tiny 上,TVD-Single 的分数 74.40 高于 SMT。
- 防御与核对: Claude-Sonnet-4.5、SafeBench 上,组合防御后 SMT 的 ASR 为 78.00%(Table 5)。FCGuard 使 GPT-5.4 与 Claude-Sonnet-4.5 上 SMT 的 ASR 变为 0.00%,对应分数仍为 10.40 与 6.00;GPT-4o 上为 84.00%(Table 6)。三名标注者给出的 SMT ASR 为 97.00%,LLM 评判为 98.00%(Table 7)。
- 作者结论: 作者称只做提示词级清洗不足以保卫启用工具的系统,需要覆盖 schema、参数生成、工具输出、校验反馈和历史的上下文校验。作者同时称,针对函数调用通路的防御可以削弱 SMT,且 Qwen3.5-9B 上的流程观察不能直接当成专有模型的普遍机制。