BreakFun:用模拟代码执行中的对象实例化越狱 LLM
BreakFun: Jailbreaking LLMs via Object Instantiation under Simulated Code Execution
AI 导读
研究者提出 BreakFun 越狱方法,把有害请求包装成代码执行模拟:提示词给出一个无害的 Python 类定义即 Trojan Schema,要求模型回答这段代码运行会打印什么,模型必须实例化对象并为每个字段编造取值,而对抗性字段名把这些取值引向攻击目标,有害内容因此作为模拟实例化的副作用出现而非直接回答。攻击由三部分组成:无害框架、Trojan Schema 和思维链干扰。在 JailbreakBench 上,BreakFun 对 13 个开源权重与商用模型的平均攻击成功率为 89%(开源权重约 98%,API 系统约 78%),在若干模型上达到 100%;消融实验显示 Trojan Schema 是贡献最大的组件。作者认为 LLM 安全需要覆盖模拟任务作为副作用产生的内容,而不只是用户直接请求的内容。