跳到正文
原文
论文追踪· arXiv:2502.11084· Yuting Huang, Chengyuan Liu, Yifeng Feng, Yiquan Wu, Chao Wu, Fei Wu, Kun Kuang·本站收录 · 原文发表

研究者提出 Rewrite to Jailbreak 方法,通过改写指令实现可迁移黑盒越狱

Rewrite to Jailbreak: Discover Learnable and Transferable Implicit Harmfulness Instruction

AI 导读

研究者提出 Rewrite to Jailbreak(R2J)方法,通过迭代探索大语言模型的弱点并自动改进攻击策略,实现可迁移的黑盒越狱。该方法仅改写原始指令,不引入额外特征,因而比现有越狱方法更高效且更难被识别。实验表明,R2J 在多个数据集和多种模型上仅需少量查询即可迁移生效。该论文已被 ACL 2025 findings 接收,代码已公开。

阅读原文arxiv.org