跳到正文
原文
论文追踪· arXiv:2512.23173· Zhen Liang, Hai Huang, Zhengkui Chen·本站收录 · 原文发表

EquaCode:通过方程求解与代码补全实现多策略越狱

EquaCode: A Multi-Strategy Jailbreak Approach for Large Language Models via Equation Solving and Code Completion

论文速读

攻击

据论文 PDF 整理(AI 生成),以原文为准

EquaCode以方程加代码补全越狱;据Table 1,AdvBench上GPT-4-turbo的ASR为98.46%。

威胁模型黑盒手动越狱:攻击者不访问参数或梯度,只经API提交提示词,目标是让已对齐LLM输出有害执行步骤。

问题
对齐后的LLM仍可能被对抗提示词引出有害输出。作者认为现有越狱多停在自然语言、且只用单一策略,因而不足以评估稳健性。
方法
EquaCode先把恶意查询拆成主体、工具和未知步骤,写成文本方程,再放入Solver类要求补全执行步骤。作者称不访问参数,单次API请求即可。
实验与结果
Table 1中EquaCoder对GPT-4-turbo的ASR为98.46%,六模型平均78.98%,Llama3.1-405B为17.88%。Table 2四模型平均98.99%。50条消融里完整方法平均87.33%,高于单独模块。
局限与可以继续做的
作者指出成功率依赖目标模型的数学与代码能力,并计划增加任务形式与自动化构造。实验覆盖AdvBench及Table 1、2、4中的模型;Llama-3.3-70B无ASR。论文未报告重复次数和防御绕过率的分母。
实验设置GPT-4、GPT-4-Turbo 等 · AdvBench · ASR、PPL mean 等
威胁模型
黑盒手动越狱:攻击者不访问参数或梯度,只经API提交提示词,目标是让已对齐LLM输出有害执行步骤。能力是用统一模板把恶意查询改成方程再嵌入代码补全;摘要称仅单次查询。成功由评审模型打1–10分,仅10分计成功。
被测模型
GPT-4GPT-4-TurboGPT-3.5-TurboGPT-4oGPT-4o-miniLlama-3.1-405BGemini-1.5-ProDeepSeek-R1Grok-3DeepSeek-V3Llama-3.1-70BLlama-3.3-70BLlama Guard 7BLlama 2 Guard 8BLlama 3 Guard 8B
基准
AdvBench
指标
ASRPPL meanbypass rate
AI 导读研究者提出 EquaCode,一种通过方程求解与代码补全实施的多策略越狱方法,将恶意意图转化为数学问题并要求大语言模型用代码求解,借跨域任务的复杂度把模型注意力从安全约束转向任务完成。实验显示,该方法在 GPT 系列上平均攻击成功率为 91.19%,在 3 个 SOTA 大语言模型上达到 98.65%,且均只需单次查询。消融实验表明其效果优于单独使用数学方程模块或代码模块,作者称两者存在协同效应。该论文为预印本,修订版将收录于 AAAI 2026。

研究者提出 EquaCode,一种通过方程求解与代码补全实施的多策略越狱方法,将恶意意图转化为数学问题并要求大语言模型用代码求解,借跨域任务的复杂度把模型注意力从安全约束转向任务完成。实验显示,该方法在 GPT 系列上平均攻击成功率为 91.19%,在 3 个 SOTA 大语言模型上达到 98.65%,且均只需单次查询。消融实验表明其效果优于单独使用数学方程模块或代码模块,作者称两者存在协同效应。该论文为预印本,修订版将收录于 AAAI 2026。

深度解读

6 个问题,点开问题读完整回答

  1. 这篇论文试图解决什么问题?

    EquaCode用方程求解与代码补全做单次查询越狱,以评估对齐后的稳健性。

    现有越狱主要在自然语言上使用单一策略,作者认为这不足以评估 LLM 对齐后的稳健性。

    • 出现场景: 作者称 LLM 已用于问答、翻译和代码生成,但生成能力可能被用于违法内容或泄露隐私。监督微调与 RLHF 之后,模型仍可能被对抗提示词绕过防护并给出有害或受限输出,从而给部署带来挑战。
    • 现有不足: 作者引 Wei 等的 mismatched generalization:预训练数据大于安全训练数据,分布外但仍符合已学行为的提示可以绕过防护。作者称现有方法以角色扮演或编码等单一策略为主,提示多样性不足。
    • 核心假设: 作者假设方程求解和代码补全等非自然语言域仍有安全弱点;把有害提示改成对齐阶段少见或不存在的形式,可绕过依赖自然语言语义的过滤。
    • 本文提出: EquaCode 先把恶意查询变成方程求解,再要求用代码补全未知步骤,借跨域任务把注意引向完成任务。作者在引言中称这是首个多策略攻击,并称数学任务并入代码任务时存在放大效应。
    • 威胁模型:
      • 目标: 让 LLM 产出有害或受限内容,具体是给出达成恶意意图的执行步骤。
      • 知识: 黑盒。作者称不访问内部参数或梯度;白盒优化需要参数,因而不适用于闭源 API。
      • 能力: 攻击者只控制经 API 提交的提示词,用统一模板把查询改成方程再嵌入代码补全。摘要称全部结果仅单次查询;攻击成本一节称单次 API 请求,并称比白盒和许多黑盒方法更省成本。论文未报告具体耗时。
      • 受害系统与判定: 已做安全对齐的 LLM,实验包含商用 GPT 系列等。ASR 为成功查询占比;评审模型打 1–10 分,仅 10 分且回复与查询相关算成功。
  2. 有哪些相关研究?

    相关工作分为白盒优化、辅助LLM迭代和手动单一策略,并以AdvBench上的多组基线对照。

    作者按自动化与手动两条线讨论越狱,并把本文放在多策略、跨域的手动攻击上。

    安全对齐与错配泛化

    • 监督微调与 RLHF: 引言把 [1] 的监督微调、[2] 的人类反馈强化学习列为使模型符合人类价值的对齐手段。
    • Jailbroken: Wei 等 [3] 讨论安全训练为何失败。作者用其中的 mismatched generalization 解释分布外提示如何绕过防护。
    • 长尾改写: 第3节称 [3, 5] 已显示,把恶意查询变成长尾形式可以绕过安全机制。

    自动化越狱

    • 白盒优化: GCG [13] 用梯度搜索可绕过安全防护的 token 序列。作者把 AutoDAN、MAC、COLD-Attack 与 GCG 归为通常需要内部参数的白盒方法,并称闭源 API 上不可行。
    • 辅助 LLM: PAIR [22] 用 LLM 迭代生成并改进候选提示。作者把 TAP、GPTFuzzer 归入同类,并称这类黑盒方法需要多轮交互,时间和资源成本更高。

    手动越狱

    • DAN: Shen 等 [4] 用角色扮演构造提示以绕过限制。作者把它作为单一策略的例子。
    • CodeChameleon: Lv 等 [6] 用误导性指令引出受限输出;作者称其采取心理学式做法。
    • 多样性: 作者称现有黑盒方法仍受提示多样性限制,多数依赖角色扮演或编码。同节还点到 DeepInception、DRA、ArtPrompt、ReNeLLM、FlipAttack 等,未逐篇展开机制。

    基线方法与基准

    • 基线方法: 作者称选取 15 个最新基线。正文列举 GCG、AutoDAN、MAC、COLD-Attack、PAIR、TAP、GPTFuzzer、BASE64、DeepInception、DRA、ArtPrompt、PromptAttack、SelfCipher、CodeChameleon、ReNeLLM、FlipAttack。Table 1 报告这些方法在六个 LLM 上的 ASR;作者称这些数字来自 [12] 的实现,并用 GPT-4 与同一套评审提示词比较。
    • 基准: AdvBench [13],520 条恶意查询,每条违反 LLM 安全约束。

    作者把 EquaCode 定位为先方程求解、再代码生成的跨域流水线,并称它不是两种策略的简单组合;同时认为自然语言域已投入大量对齐,只靠自然语言攻击不再容易取得高成功率。

  3. 论文如何解决这个问题?

    EquaCode把恶意查询写成B+C+x=A,再嵌入Solver类,要求模型补全执行步骤。

    EquaCode 把自然语言恶意查询先改写成文本方程,再嵌入代码补全,使模型去求解未知执行步骤。作者称这是按顺序设计的跨域流水线,不是两个模块的简单拼接。

    方程模块

    • 分解: 恶意查询记为 A,分成 Subject B、Tool C 和 Execution Steps。B 是行动主体,C 是手段,步骤是待求未知量 x。A、B、C 已知,x 待求。攻击者给定 B 与 C。此处不写示例中的查询、主体和工具原文。
    • 方程: 形式为 B+C+x=A。作者称这是由文本和数学符号组成的文本方程,不是普通数值方程。
    • 求解: 模型被要求解出 x,即达成恶意目标的具体步骤。作者称指定主体和工具后,模型会把注意放在生成步骤上,从而模糊意图,并绕过依赖自然语言语义的输入级过滤。

    代码模块

    • 封装: 预定义 Python 模板以 Solver 类接收 A、B、C,映射到 self.A、self.B、self.C。作者称一致命名是为了衔接方程策略和代码策略,减少混淆。
    • 待补全内容: 构造函数另初始化空列表 self.steps。solve 负责生成步骤并追加到该列表。类中还有返回主体和工具的函数;注释要求按任务生成工具描述。Figure 2 为代码封装示意。
    • 作者给出的理由: 该设计促使模型关注语法和逻辑,而不是内容是否恶意,从而绕过安全护栏。

    整体流程与使用方式

    • 两步: 先把查询数学化并求解 x,再把方程组件和恶意查询嵌入 Solver,要求在 solve 中完成步骤并描述工具。Figure 1 概括这两个模块。
    • 查询开销: 作者称模板可套到任意恶意查询,一次 API 请求完成,不需要像优化方法那样多轮改写。对照里,FlipAttack 有 4 种翻转模式和 4 种变体、共 16 种组合,需要穷举才能确定设置。
    • 未写的运行参数: 论文未写温度、top-p 或重复采样。方法本身不是迭代优化。

    成功判定

    • 定义: ASR=n/m。n 为成功越狱次数,m 为查询总数。
    • 评审: 用 LLM 判断越狱是否成功、回复是否与查询相关。分数为 1 到 10,只把 10 分计为成功。评审提示改编自 [22, 12]。主比较中作者称使用 GPT-4,并对所有方法使用同一套评审提示。
  4. 论文做了哪些实验?

    Table 1里GPT-4-turbo的ASR为98.46%,Llama3.1-405B为17.88%。

    实验设置

    • 数据: AdvBench,520 条恶意查询。消融为降低评测成本,另取 50 条违反使用政策的子集。
    • 目标模型: 4.1 节列出 12 个:GPT-3.5-Turbo、GPT-4、GPT-4-Turbo、GPT-4o、GPT-4o-mini、Llama-3.1-405B,以及 Llama-3.1-70B、Llama-3.3-70B、Gemini-1.5-Pro、DeepSeek-V3、DeepSeek-R1、Grok-3。
    • 基线: Table 1 含 GCG、AutoDAN、MAC、COLD-Attack、PAIR、TAP、Base64、GPTFuzzer、DeepInception、DRA、ArtPromopt、PromptAttack、SelfCipher、CodeChameleon、ReNeLLM、Flipattack。作者称前六个 LLM 上这些基线数字来自 [12]。
    • 指标与评审: ASR。主比较用 GPT-4 打 1–10 分,仅 10 分成功;GPT-4 同时是被测模型。Table 2 注明 evaluator 为 GPT-ASR,论文未说明此名是否即 GPT-4。消融改用开源 LLaMA 系模型评审,未给出型号。
    • 其他测量: 困惑度用 llama-7b、Llama2-7b、Llama3-8b 的 PPL mean。防御讨论涉及 Llama Guard 7B、Llama 2 Guard 8B、Llama 3 Guard 8B、关键词过滤、PPL Filter 和输出过滤。
    • 论文未报告: 重复次数、评审与人工一致性,以及各方法的具体 API 次数。

    主结果

    据 Table 1,数字为 ASR 百分数。表内方法名是 EquaCoder。“该行最高基线”是同一行里读到的最大基线格,不是另算的指标。

    表格较宽,可左右滑动

    模型EquaCoder该行最高基线基线名
    GPT-491.9286.73Flipattack
    GPT-4-turbo98.4694.04Flipattack
    GPT-3.5-turbo97.1293.65DRA
    GPT-4o87.1292.67CodeChameleon
    GPT-4o-mini81.3570.00DRA
    Llama3.1-405B17.8827.50Flipattack
    Average78.9874.94Flipattack
    • 与正文不一致处: 作者称 EquaCode 在 GPT-4、GPT-4-Turbo、GPT-3.5-Turbo、GPT-4o-mini 上最高,并把 GPT-3.5-Turbo 写成 97.88%;该格在表中是 97.12%。作者称 GPT-4o 与 Llama3.1-405B 分别排第二、第三,且 GPT-4o-mini 比次优方法高 20%。表中 GPT-4o 的 EquaCoder 低于 CodeChameleon、Flipattack 和 DRA;Llama3.1-405B 上低于 Flipattack。
    • 多套总括数字: 作者称 Table 1 的 78.98% 是全部目标 LLM 上的最高平均,但该表只有六个模型。摘要另写 GPT 系列平均 91.19%、10 个 SOTA 模型平均 86.98%,且都只做单次查询。贡献点写最高平均 84.95%、GPT 系列平均 92.78%、GPT-4 为 91.19%、GPT-4-Turbo 为 98.46%。结论写 GPT 系列超过 90%。与表直接对应的是 78.98% 和 GPT-4-Turbo 的 98.46%;表中 GPT-4 是 91.92%。
    • 低 ASR: 作者称各方法在 LLaMA-3.1-405B 上 ASR 都低,并称该模型安全对齐较强,针对它的越狱仍有改进空间。这是结果讨论,不是 Limitations 节。

    消融

    • 测了什么: Table 4 比较 STSA、仅 Equation、仅 Code 与完整 EquaCode。STSA 只要求用自然语言把查询拆成可执行步骤。50 条子集;因作者称 Llama-3.1-405B 先前越狱成功率很低,此处改用 Llama 3.1 70B。括号是 EquaCode 相对该单模块的 ASR 差。
    • 结果: 平均 ASR 为 STSA 17.33%、Equation 44.67%、Code 65.73%、EquaCode 87.33%。GPT-4-turbo 上 Code 与 EquaCode 同为 98.00(括号 0)。GPT-3.5-turbo 上 Equation 74.00 低于 STSA 76.00,是表中 Equation 低于 STSA 的唯一模型。
    • 作者解读: 作者称 Equation 比 STSA 平均高 27.34%,Code 比 STSA 高 48.4%,并称代码理解与补全上的弱点大于数学推理。GPT-3.5-Turbo 的下降,作者称是 2%,并归因于数学推理较弱:它重排方程项,没有生成可执行指令。作者称 GPT-4o-mini 上 EquaCode 是 Code 的 2.8 倍、Equation 的 4.6 倍(表内 74.00、26.00、16.00)。作者称完整方法比 Equation 高 62.66%、比 Code 高 21.57%,且大于部分之和;表内平均是 87.33%、44.67%、65.73%,平均 ASR 以表为准。

    额外模型、困惑度与防御

    • Table 2: Gemini 1.5、DeepSeek R1、DeepSeek v3 为 100,Grok3 为 95.96,平均 98.99。表注写 evaluator 为 GPT-ASR。正文称平均 97.62%,并列入 GPT-4.1 与 Claude 3.7;这两列不在 Table 2,4.1 节的模型列表也没有它们。
    • Table 3: Equacoder 的 PPL mean 为 llama-7b 11.14、Llama2-7b 10.90、Llama3-8b 14.60。FlipAttack 为 820.44、543.27、782.42。ArtPrompt 为 6.85、3.25、1.99,三列都低于 Equacoder。作者称编码或加密类方法困惑度高,EquaCode 较低,基于困惑度的过滤不能检测或缓解该攻击。
    • 护栏: 作者称 EquaCode 绕过 Llama Guard 7B 的比例为 100%,Llama 2 Guard 8B 为 67.88%;Llama 3 Guard 8B 的绕过成功率相对较低,论文未给数字。作者称 PPL Filter 无效,因为指令被做成低困惑度。输出过滤作者称更难绕过,观察到的成功率只有 14%,但须等完整回复生成后再审,延迟高。这些比例的数据集、受害 LLM 和分母,论文未说明。关键词过滤作者称能挡住一部分显式恶意问题,但易误报,商业应用很少采用。安全微调作者称计算贵、难扩展,可能落后于越狱变化,有时还会损害通用能力;论文未报告微调后的效用或 ASR。

    其他消融与分析

    • Equation 相对 STSA:作者称 GPT-4 从 2% 到 42.0%,GPT-4-Turbo 从 26% 到 74%;GPT-4o、GPT-4o-mini、LLaMA-3.1-70B 从 0% 到 30%、16%、32%(Table 4)。
    • Code 相对 STSA:作者称 GPT-4 提高 64%、GPT-4-Turbo 提高 72%;GPT-3.5-Turbo、GPT-4o、GPT-4o-mini、LLaMA-3.1-70B 分别提高 20%、54%、26%、54%。
    • Table 3 的 Origin 行为 30.66、29.78、62.16,论文未在表注定义 Origin。Caesar Cipher 为 335.50、194.38、166.69;Morse Cipher 为 11.51、10.23、10.10。
    • 攻击成本只有定性比较:白盒优化耗 GPU、部署时 API 较少;辅助 LLM 方法 API 多;手动方法通常调用更少。论文未报告具体查询次数或耗时。
    • 4.4 节用梯度显著性分析解释注意转移。作者称 Figure 3 中,原始恶意查询的高梯度落在伤害相关 token;写成方程后注意分散到 equation、show、steps;嵌入 Python 类后更多在 following、code、Solver、steps。图题仅为 intention,色块无法从文本核对。作者把有效性主要归于 capability-safety misalignment:数学和代码预训练更充分,而 RLHF 数据以自然语言为主。
  5. 有什么可以进一步探索的点?

    作者指出效果依赖数学与代码能力,并计划扩展任务形式和自动化构造。

    作者指出的局限与后续方向

    • 能力依赖: 效果依赖目标 LLM 具备足够的数学和编程理解与处理能力,须能正确解析并执行嵌在方程或代码结构中的对抗指令;用于符号推理或代码生成较弱的模型时,这一依赖会限制成功率(4.6)。
    • 策略多样性: 作者计划纳入更广的任务形式,扩大策略组合的多样性,以改进攻击的泛化与适配(4.6)。
    • 自动化: 作者计划探索攻击构造的自动化,以减少人工,同时改进攻击的效率与效果(4.6)。

    Limitations and Future Work 只写了以上三点。结果节里关于 Llama-3.1-405B 仍有改进空间的句子,不计入这里。

    实验覆盖范围

    • 主指标 ASR 使用 AdvBench 的 520 条恶意查询;Table 4 的消融是 50 条子集。成功条件是评审分等于 10。
    • 4.1 节列出 12 个 LLM。Table 1 报告其中 6 个相对 16 个基线的 ASR;Table 2 报告 Gemini 1.5、DeepSeek R1、Grok3、DeepSeek v3;Table 4 含 Llama 3.1 70B。Llama-3.3-70B 在 4.1 节被列出,论文未报告其 ASR。
    • 主比较的评审模型是 GPT-4;Table 2 写 GPT-ASR;消融写开源 LLaMA 系模型。论文未报告重复次数,也未报告评审与人工一致性。
    • 4.5 节给出 Llama Guard 7B、Llama 2 Guard 8B 的绕过率,并讨论 Llama 3 Guard 8B、PPL Filter、关键词过滤、输出过滤和安全微调。论文未报告绕过率的分母、对应数据集和受害 LLM,也未报告微调后的效用。
    • 前六个 LLM 的基线 ASR,作者称来自 [12]。攻击成本按白盒、辅助 LLM 和手动方法做了定性比较;论文未报告各方法的具体 API 次数。
  6. 总结一下论文的主要内容

    EquaCode串联方程与代码补全做黑盒单次越狱;GPT-4-turbo上ASR为98.46%,405B上为17.88%。

    EquaCode 是一种黑盒、单次查询的多策略越狱:把恶意请求改写成方程求解,再嵌入代码补全。

    • 问题: 作者认为现有越狱多在自然语言上使用单一策略,提示多样性不足,因而难以评估对齐之后的稳健性。假设是方程求解和代码补全仍有安全弱点。
    • 方法: 查询被分成主体、工具和未知步骤,写成文本方程,再映射进 Solver 类,由模型补全步骤并描述工具。作者称模板可套任意恶意查询,一次 API 请求,且不访问参数。成功标准是评审模型打到 10 分。
    • 主结果: 在 AdvBench 上,Table 1 的 EquaCoder 对 GPT-4、GPT-4-turbo、GPT-3.5-turbo、GPT-4o、GPT-4o-mini、Llama3.1-405B 的 ASR 为 91.92%、98.46%、97.12%、87.12%、81.35%、17.88%,六模型平均 78.98%。GPT-4o 与 Llama3.1-405B 上,表中另有更高的基线。
    • 其他结果: Table 2 四模型平均 98.99%,其中三个为 100%,Grok3 为 95.96%。50 条消融中,EquaCode 平均 87.33%,Equation 为 44.67%,Code 为 65.73%,STSA 为 17.33%。作者称两模块合用有协同,效果大于单独使用。
    • 作者结论: 作者认为跨域组合会放大数学与代码任务上的安全弱点,并把原因归于能力与安全错配:这些能力预训练更充分,而 RLHF 数据以自然语言为主。作者同时指出,目标模型数学或代码能力不足时攻击会受限制,并计划扩展任务形式和自动化构造。摘要中的 91.19%(GPT 系列)和 86.98%(10 个模型)与 Table 1 的 78.98% 不是同一汇总口径。
阅读原文arxiv.org