研究者提出 Rewrite to Jailbreak 方法,通过改写指令实现可迁移黑盒越狱
Rewrite to Jailbreak: Discover Learnable and Transferable Implicit Harmfulness Instruction
AI 导读
研究者提出 Rewrite to Jailbreak(R2J)方法,通过迭代探索大语言模型的弱点并自动改进攻击策略,实现可迁移的黑盒越狱。该方法仅改写原始指令,不引入额外特征,因而比现有越狱方法更高效且更难被识别。实验表明,R2J 在多个数据集和多种模型上仅需少量查询即可迁移生效。该论文已被 ACL 2025 findings 接收,代码已公开。