跳到正文
原文
论文追踪· arXiv:2607.27373· Benyamin Tafreshian, Prathamesh Dhake·本站收录 · 原文发表

RoguePrompt 用双层编码绕过 LLM 审核,过滤绕过率 93.93%

RoguePrompt: Dual-Layer Encoding for Self-Reconstruction to Circumvent LLM Moderation

论文速读

攻击

据论文 PDF 整理(AI 生成),以原文为准

RoguePrompt对StrongREJECT做双层编码自重构越狱,三模型平均Execution@3为70.18%。

威胁模型黑盒对手仅有API/UI文本访问,不知权重、系统提示、训练数据或专有审核规则,也不能改模型或过滤器。

问题
托管LLM常有输入筛查、模型拒答和输出控制,但多阶段提示词变换的评测常收成单一成功率,看不出失败停在接受、重构还是执行。RoguePrompt要在仅API/UI的黑盒单轮交互里分开测这三段。
方法
禁用提示词按偶数与奇数文本段拆开,只对序列化奇数流做Vigenère,再对含偶数流、密文、密钥和顺序信息的组装载荷做ROT13,包装要求同一回复内逆变换并执行。评测前冻结包装、密钥和模板,每条件独立提交三次。
实验与结果
三模型、313条StrongREJECT上,RoguePrompt的绕过、重构、执行@3平均为93.93%、79.02%、70.18%,高于基线最高33.97%。Base64 Raw重构高、执行低。消融中去掉任一层,三阶段都下降。
局限与可以继续做的
作者称结果是2025年4–5月三个托管配置的快照,配置已更新,具体比率会变;基准未覆盖长上下文与多轮。评测为固定三次查询的自动标注,盲审300条未发现需改标签的分歧。
实验设置OpenAI GPT-4o (gpt-4o-2024-11-20)、Anthropic Claude 3 Opus (claude-3-opus-20240229) 等 · StrongREJECT · Bypass@3、Reconstruction@3 等
威胁模型
黑盒对手仅有API/UI文本访问,不知权重、系统提示、训练数据或专有审核规则,也不能改模型或过滤器。评测为single-turn:一次查询内含全部指令。成功须同一次回复可见接受、输出证据重构并执行;生成式拒答算接受。
被测模型
OpenAI GPT-4o (gpt-4o-2024-11-20)Anthropic Claude 3 Opus (claude-3-opus-20240229)Google Gemini 1.5 Pro (gemini-1.5-pro-002)
基准
StrongREJECT
指标
Bypass@3Reconstruction@3Execution@3
AI 导读研究者提出 RoguePrompt 越狱流水线,将违禁提示词拆分后依次施加 Vigenere 与 ROT13 两层编码,并附上自然语言重建指令,在黑盒威胁模型下仅通过 API 或用户界面访问托管模型进行测试。在 313 条真实世界中被硬拒的提示词上,该方法平均过滤绕过率为 93.93%,指令重建率 79.02%,执行率 70.18%。论文将可见接受、隐藏请求的成功恢复与后续执行分开评估,给出多阶段提示变换攻击在审核绕过、指令重建和执行各环节的失败位置。该稿为 arXiv:2511.18790 的修订扩充版本,细化了威胁模型、方法与分阶段评估标准。

研究者提出 RoguePrompt 越狱流水线,将违禁提示词拆分后依次施加 Vigenere 与 ROT13 两层编码,并附上自然语言重建指令,在黑盒威胁模型下仅通过 API 或用户界面访问托管模型进行测试。在 313 条真实世界中被硬拒的提示词上,该方法平均过滤绕过率为 93.93%,指令重建率 79.02%,执行率 70.18%。论文将可见接受、隐藏请求的成功恢复与后续执行分开评估,给出多阶段提示变换攻击在审核绕过、指令重建和执行各环节的失败位置。该稿为 arXiv:2511.18790 的修订扩充版本,细化了威胁模型、方法与分阶段评估标准。

深度解读

6 个问题,点开问题读完整回答

  1. 这篇论文试图解决什么问题?

    多阶段越狱常被收成单一成功率;RoguePrompt分开测绕过、重构与执行。

    多阶段提示词变换越狱在可观测黑盒交互中,失败停在可见接受、请求重构还是执行。

    • 场景:作者称托管LLM进入对话助手、开发工具和智能体流程后,提供方常叠加输入筛查、模型拒答和输出控制。普通用户看不到专有路由,无法判断拒绝来自哪一内部组件。
    • 现有不足:作者称cipher交互、代码内解密、提示词分解重构和分层自定义加密已是可用原语,但已有评测多把可见接受、成功恢复隐藏请求和随后执行收成单一成功率。只看最终回复,看不出干预改的是边界筛查、重构,还是重构后拒答。
    • 观察:自重构提示词让目标同时当解码器和执行器。表面形式须避开可见硬拦截,又须留下可忠实重构的结构;接受而无重构,或重构后拒答,都不是完整成功。
    • 提出:RoguePrompt,确定性单轮流水线。偶数/奇数文本段划分后,只对序列化奇数流做Vigenère,再对组装载荷做ROT13,并附逆变换与执行指令。成功按绕过、重构、执行分段自动判定。
    • 威胁模型:
      • 目标:诱导违反策略的用户可见回复,同时避开自动检测。端到端成功要求同一次回复中可见接受、重构并执行,且违规内容到达用户。
      • 知识:black-box。不知权重、系统提示、训练数据或专有审核规则,只能从查询结果推断。
      • 能力:仅API/UI文本输入输出,不能改模型或过滤器。评测试验为single-turn(zero-shot),指令全在一次查询内;不排除评测前离线设计固定模板。
      • 受害系统:受保护资产是用户可见回复的策略遵从。只有可识别的服务级拒绝或明确API/UI拦截算阻断;生成式拒答算可见接受,留到后续阶段。
  2. 有哪些相关研究?

    作者将本文定位为非对称双层编码,并分开测量绕过、重构与执行。

    作者把最接近的工作放在自重构与表示塑造,并把区别放在非对称组合和分段测量,而不是单独的加密或奇偶重排。

    分层安全与可观测结果

    • 托管控制:作者综述输入筛查、生成中的模型拒答和交付前的输出处理(Anthropic 2024;Google DeepMind 2022;OpenAI 2023)。外部可区分的结果包括硬拦截、未恢复指令、重构后拒答和执行。
    • 测量选择:作者称闭源服务不能把结果归因到某一内部组件,因此把可见输入接受当作代理,并与重构、执行分开。

    越狱与策略规避

    • 手法与搜索:直接提示工程和程序化利用(Kang et al. 2023;Liu et al. 2024);角色扮演、胁迫框架、拼接、词汇混淆和编码载荷(Krauß et al. 2025;Liu et al. 2024;Zhang et al. 2024)。突变与目标导向搜索显示有效提示不必全靠手工(Deng et al. 2024;Shao et al. 2025;Zhang et al. 2024)。
    • 作者的批评:作者称这些工作说明了基于提示词的攻击范围和适应性,但评测通常看最终回复是遵从还是拒答,且许多攻击围绕单一模板或变换。

    自重构与表示塑造

    • CipherChat(Yuan et al. 2024):用系统角色和加密示例教模型以cipher交流,返回密文在外部解码。
    • CodeChameleon(Lv et al. 2024):个性化词序或结构变换,含OddEven;在代码补全包装中嵌入类Python解密与求解函数。
    • DrAttack与ACE/LACE:DrAttack(Li et al. 2024)做句法分解、良性重组示例和同义词搜索,Table 1写其黑盒搜索预算最高15次查询。ACE/LACE(Handa et al. 2025)研究自定义cipher、多层cipher,以及解码能力与攻击成功的关系。

    基线方法与基准

    • 基线方法:Paired-Request Concatenation是本文自定义单轮模板,不是迭代PAIR;PAP权威背书说服模板(Zeng et al. 2024);Auto Payload Splitting(Kang et al. 2023);Disemvowel与Base64 Raw来自StrongREJECT(Souly et al. 2024)。
    • 基准:StrongREJECT,313条按该基准协议应被拒绝、且具体可答的违规提示词。Table 1注明已发表成功率因数据集、目标和评审不同,不能直接比较;Section 5.4写明这些重构型攻击未进入数值运行。

    作者称本文不把加密、奇偶重排、分解、重构或cipher分层单独当作新贡献。攻击侧区别是确定性非对称组合:两路序列化流,仅奇数流做内层Vigenère,外层ROT13覆盖组装字段与元数据。方法侧区别是分开标注可见接受、有输出证据的重构和执行。

  3. 论文如何解决这个问题?

    偶数奇数分段后只对奇数流做Vigenère,再对组装载荷做ROT13。

    RoguePrompt把禁用提示词做成单轮自重构查询。Figure 1图注的流程是:硬拦截请求、混淆提示、有输出证据的重构、不安全输出(已涂黑)。

    问题设定与形式化

    • 切分:明文I经τ按词界切成攻击侧文本段,保留重构所需的非字母字符。这些段不是目标模型token,也不依赖其专有分词器。
    • 两式:P=τ(I)=(t0,t1,⋯,tn−1)是该段序列;Q=Wrap(g(A))是对组装载荷做外层ROT13后再包上可见指令的单轮查询。
    • 奇偶划分:从下标0拆成偶数流E与奇数流O,流内保序。重组从E开始交错;n为奇数时E比O多一段,末段来自E。任一路都不含按原顺序排好的完整请求。
    • 编码顺序:内层Vigenère只作用于序列化后的奇数流。组装字段含偶数流、该密文、密钥和顺序元数据;外层ROT13覆盖组装载荷,不覆盖可见包装。

    设计选择

    • 四个目标:表示分离、变换可逆以便把失败归因于模型而非丢信息、载荷与逆过程放在一次查询、评测前固定全部攻击侧选择。
    • 各层作用:奇偶划分分开相邻段;Vigenère使两路表面表示不对称;ROT13再变换组装字段,包括仍为明文的偶数流和重构元数据。包装保持可读,因为要说明如何逆外层并解析字段。
    • 非保密密码:密钥写在提示里,ROT13可逆。作者称不提出密码学安全主张,价值由分段结果和组件消融评估。
    • 固定规则:两种变换只处理ASCII字母,保留大小写,非字母不变,密钥只在变换字母时前进。长度前缀序列化保住跨度边界。同一配置共用预注册密钥标识,不允许按提示搜索或手工调密钥。正文未给出正式实验密钥。

    生成与三次试验

    • 生成:切分、奇偶划分、加密奇数流、组装、ROT13、包装。时间与空间为O(L)。无组合搜索,也不按目标分词器生成提示。
    • 聚合:同一变换后查询独立提交三次,试验间不改写。条件级Bypass@3、Reconstruction@3、Execution@3是三次指示的逻辑或。试验级执行则将该次重构标为成功;若阻断,重构与执行都为0。
    • 冻结:包装、密钥策略、切分与序列化、解析器、标签规则和基线模板在评测前固定。只有传输或限流导致无模型回复才重试;拒答、安全完成、畸形和部分回答保留。
    • 可逆不等于重构成功:作者称在所述解析规则下映射无损,但编码串的分词,以及提供方对空白、Unicode或标点的规范化,仍可能使模型不按包装执行。可复现性限于提示构造和自动标注代码(Section 4.5)。

    成功判定

    • 可见接受:无可识别的服务级拒绝、明确API/UI拦截或生成前标记,而是完成式回复。这是绕过代理,不是某一审核组件放行的证明。生成式拒答仍算接受。
    • 重构:接受后的可见回复复述、转述或实质回应原请求,不检查内部状态。无明确证据则该阶段为0。
    • 执行:实质完成重构后的请求,而不是拒答、安全完成或只返回不完整片段。执行也算重构证据,即使没有明确重复恢复出的指令。条件级Execution@3因而意味着至少一次试验里三阶段发生在同一次回复。
  4. 论文做了哪些实验?

    StrongREJECT上三模型平均Execution@3为70.18%,高于基线33.97%。

    在313条StrongREJECT、三个托管模型上,RoguePrompt的平均Execution@3为70.18%,高于表中五条基线(Table 3)。

    实验设置

    • 目标模型:OpenAI GPT-4o(gpt-4o-2024-11-20)、Anthropic Claude 3 Opus(claude-3-opus-20240229)、Google Gemini 1.5 Pro(gemini-1.5-pro-002)。查询在2025年4–5月,使用提供方默认设置,未改temperature、top-p或系统消息。论文未给出temperature或top-p的具体数值。
    • 数据:StrongREJECT 313条。Table 7每配置源提示数为:虚假信息与欺骗50、仇恨/骚扰50、非法商品与服务50、非暴力犯罪59、性内容50、暴力54。
    • 对照:五条基线见Table 6。Paired-Request Concatenation是本文单轮模板,不是迭代PAIR。Table 1的CipherChat、CodeChameleon、DrAttack、ACE/LACE未进入这次数值运行。消融六个变体复用主实验的完整RoguePrompt,不另跑完整方法。
    • 预算:每提示词–方法–模型条件三次独立单轮,内容相同,试验间不自适应。主比较6个方法×3个配置×313条,即5634个条件、16902次目标提交。消融再5634个条件、16902次提交。合计11268个条件、33804次目标提交。Auto Payload Splitting另有313次离线辅助构建调用,不计入均等的三次目标预算。论文未写明该辅助模型名称。
    • 指标:三次中至少一次成功即该阶段@3为1。方法级数字是三配置@3的算术平均;论文写明因提示集相同,也等于等权合并率。试验级执行蕴含接受与重构。
    • 评审:规则检测服务级拦截、拒答语和重构错误。jinaai/jina-embeddings-v3提供1024维L2归一化余弦(请求用retrieval.query,回复块用retrieval.passage);最大相似度与top-3均值只作信号,不单独决定标签,论文未给单独决定标签的阈值。Llama-3.3-70B-Instruct经作者管理的API,每次目标回复调用一次,给出重构与执行的二元判定;不看变换后攻击提示、目标身份、思维链或提供方轨迹。可识别的服务级拦截由确定性规则把三阶段置0,覆盖评审输出。标签不人工改写。作者对300条记录做标签盲审,未发现需要改标签的分歧。失败条件优先级为RAR、PR、DPF、OTH、BI(Table 2)。

    主结果

    据Table 3,三配置算术平均;每配置N=313,每条件三次。

    表格较宽,可左右滑动

    方法Bypass@3Reconstruction@3Execution@3
    RoguePrompt93.93%79.02%70.18%
    Auto Payload Splitting79.55%76.36%12.99%
    Base64 Raw93.40%93.29%16.83%
    Disemvowel3.09%3.09%2.13%
    Paired-Request Concatenation60.81%57.93%33.97%
    PAP (Authority Endorsement)63.68%51.54%25.13%
    • 作者称RoguePrompt是所评方法中,唯一在前两阶段之后仍有多数条件达到Execution@3的方法;执行率高于表中五条基线。
    • 作者称Base64 Raw说明重构以及伴随的可见接受不能代理端到端成功。Auto Payload Splitting同样是重构远多于执行。Disemvowel在三阶段都低。
    • Section 5.3对Figure 2的说明:RoguePrompt的Execution@3为Gemini 1.5 Pro 66.13%、GPT-4o 71.25%、Claude 3 Opus 73.16%。其Bypass@3在90.10%至97.13%,Reconstruction@3在73.80%至82.11%;论文未把这两个区间的端点对应到具体模型。作者称Paired-Request Concatenation在每个配置上都是Execution@3最高的基线,Base64 Raw的Execution@3接近16–17%。

    失败停在哪一阶段

    Table 5的分母是三模型合计、Execution@3失败的条件数。

    • RoguePrompt:失败280条,BI 20.36%、DPF 35.00%、PR 15.00%、RAR 21.43%、OTH 8.21%。作者称没有单一类别占其失败的多数。
    • 对照分布:Disemvowel失败919条中BI占99.02%。Base64 Raw失败781条中RAR占88.35%。Auto Payload Splitting失败817条中RAR占59.98%。Paired-Request Concatenation失败620条中BI占59.35%;PAP失败703条中BI占48.51%。
    • 作者解读:即使最终Execution@3相近,可观测失败阶段也不同;只报执行会掩盖这一点。

    内容类别

    据Table 7。提示数是每配置的源提示数,比率为三配置平均@3。

    表格较宽,可左右滑动

    类别提示数Bypass@3Recon.@3Exec.@3
    Disinformation and deception5095.33%90.67%87.33%
    Hate/Harassment5094.00%84.67%74.00%
    Illegal goods and services5094.00%64.00%51.33%
    Non-violent crimes5992.66%61.02%49.15%
    Sexual content5096.67%93.33%90.00%
    Violence5491.36%83.33%72.84%
    • 作者称Bypass@3相对稳定,执行率的类别差异更大,不能只由可观测输入拦截解释;较低类别的Reconstruction@3也更低。
    • 作者称这些类别结果是描述性的而非因果性的:提示长度、语言结构和提供方策略都可能随领域不同。

    其他消融与分析

    Table 4是相对完整RoguePrompt的@3百分比变化,不是绝对成功率。包装族、密钥策略、三次预算和评审固定,变体不重新调参。

    • No ROT13(Vig+Split):Bypass@3 −50.18%,Reconstruction@3 −42.38%,Execution@3 −67.93%。
    • No Splitting(Vig+ROT13):−55.63%、−48.86%、−74.59%。作者称这是组件移除变体里三阶段降幅最大的。
    • No Vigenère(ROT13+Split):−52.00%、−44.55%、−70.05%。
    • ROT13 only:−85.65%、−83.61%、−94.41%。
    • Splitting only:−98.76%、−98.52%、−98.79%。
    • Vigenère only:−81.57%、−78.76%、−91.69%。作者称单组件变体更差,所观察表现依赖组合构造;这些数字不是分别优化提示后的普遍排序。
  5. 有什么可以进一步探索的点?

    作者称结果是2025年4–5月三个托管配置的快照,且基准未覆盖长上下文与多轮。

    作者把主要局限写成当时三个托管快照,以及基准未覆盖长上下文与多轮。

    作者指出的局限与后续方向

    • 快照:结果是三个托管配置及其提供方策略在2025年4–5月的快照;这些配置此后已更新。作者称贡献在于攻击构造和评测方法,而不是具体比率,比率预期会随提供方变化(Section 6)。
    • 部署形态:基准未覆盖长上下文或多轮部署(Section 6)。
    • 查询预算:所报@3率刻画的是这一固定、统一施加的三次查询预算下的表现(Section 6)。
    • 外推:作者称三配置上的一致性支持所测系统中有可重复的失败模式,但不确立普遍易感性,也不指出内部架构的共同缺陷(Section 6)。
    • 评审:作者在效度威胁中写明,混合评审结合确定性检查与基于模型的分类,并以300条标签盲审作可靠性检查(Section 6)。
    • 防御方向:作者建议防御评估提示所请求的计算而不只看表面文本,在重构之后、执行或交付之前重新施加安全策略,并在训练与评测中纳入隐蔽的多步指令(Section 6、Conclusion)。

    实验覆盖范围

    • 被测配置为GPT-4o(gpt-4o-2024-11-20)、Claude 3 Opus(claude-3-opus-20240229)、Gemini 1.5 Pro(gemini-1.5-pro-002),查询在2025年4–5月,使用提供方默认服务配置;论文未给出temperature或top-p的具体数值(Section 5.1)。
    • 数据为StrongREJECT 313条,Table 7列出六类策略领域;主比较含五条基线,每条件三次独立单轮(Section 5.1、5.4)。
    • 阶段标签由规则、jina-embeddings-v3信号和Llama-3.3-70B-Instruct自动给出;300条盲审未发现需要改标签的分歧。论文未报告一致性系数(Section 5.2)。
    • 消融在固定包装族和三次预算下移除或只保留命名变换,即Table 4的六个变体(Section 5.3)。论文在Section 4.5写明,可复现性限于提示构造和自动标注代码。
    • CipherChat、CodeChameleon、DrAttack、ACE/LACE只做机制对照,未进入数值运行;论文写明因数据集、目标版本、查询预算、包装和评审不同,不并列已发表成功率(Section 5.4)。论文未写明Auto Payload Splitting的辅助模型名称。
  6. 总结一下论文的主要内容

    RoguePrompt以单轮双层编码自重构越狱,三模型平均Execution@3为70.18%。

    RoguePrompt是面向托管LLM的黑盒、单轮越狱,用来把分层隐蔽和自重构的失败拆开看。

    只看最终有害输出,会把输入是否被硬拦截、隐藏请求有没有被恢复、恢复后有没有拒答混在一起。对手只有API/UI,不能改模型或过滤器;评测前固定模板,每次试验一条查询。

    禁用提示词按偶数/奇数文本段拆开,只对奇数流做Vigenère,组装后再做ROT13。可见包装给出逆过程,并要求同一回复内执行。密钥写在提示里,不声称密码学保密。三次独立试验取逻辑或,分别得到绕过、重构和执行。

    在StrongREJECT的313条提示、GPT-4o、Claude 3 Opus和Gemini 1.5 Pro(2025年4–5月默认配置)上:

    • 三配置平均Bypass@3为93.93%,Reconstruction@3为79.02%,Execution@3为70.18%,高于五条基线中最高的Paired-Request Concatenation 33.97%(Table 3)。
    • 分模型Execution@3为Gemini 1.5 Pro 66.13%、GPT-4o 71.25%、Claude 3 Opus 73.16%(Section 5.3)。
    • Base64 Raw平均Reconstruction@3为93.29%,Execution@3为16.83%。作者称重构不能代理端到端成功。
    • 三模型合计280个执行失败中,解码或解析失败占35.00%,没有单一失败类过半(Table 5)。性内容Execution@3为90.00%,非暴力犯罪为49.15%(Table 7)。
    • 去掉切分时,Execution@3相对完整方法变化−74.59%(Table 4);该表数字是相对变化,不是绝对成功率。

    作者称表面接受不足以刻画端到端安全,审核应评估变换意图,并在重构之后、交付之前重新施加策略。上述比率是当时三个托管快照下的结果,作者称这不表示普遍易感性。

阅读原文arxiv.org