RoguePrompt:双层加密自重构以绕过 LLM 内容审核
RoguePrompt: Dual-Layer Ciphering for Self-Reconstruction to Circumvent LLM Moderation
AI 导读
论文提出 RoguePrompt,一种自动化越狱流水线,通过将违禁提示词拆分并施加 ROT-13 与 Vigenère 两层嵌套编码,再附上自然语言解码指令,把违禁请求伪装成看似无害的提示词,诱导模型在单次查询内自行重构并执行原始意图。在仅能访问 API 和 UI 的黑盒威胁模型下,该方法在 313 条真实被硬拒提示词上平均实现 93.93% 过滤绕过、79.02% 指令重构和 70.18% 执行成功率。该论文已被作者撤回,由扩展版本 arXiv:2607.27373 取代。