CodeMimicry:利用代码域安全泛化滞后实现结构化代码补全越狱
CodeMimicry: Exploiting Safety Generalization Lag in Large Language Models via Structured Code Completion
AI 导读
研究者提出 CodeMimicry,一个全自动黑盒越狱框架,把恶意意图嵌入语法合法的面向对象代码,借代码补全任务诱导模型输出有害内容。在 8 个商用大语言模型上,该方法在 AdvBench 上达到 96.25% 攻击成功率、平均仅 1.51 次查询,在 HarmBench 上为 96.07% 与 1.46 次查询,明显优于模板类和优化类基线。作者将这一现象归因于安全泛化滞后,即主要在自然语言上训练的对齐难以迁移到代码域,形成代码补全盲区。潜空间分析显示,成功的越狱样本在表示上接近良性代码,并系统性地避开拒答方向;激活引导实验进一步支持这一解释。作者也指出,该方法依赖目标模型的代码生成能力,且对注释与 docstring 这类字符串侧信道有依赖,正则过滤注释后攻击成功率降至 20% 至 26%。
论文速读
- 大模型的安全对齐主要在自然语言上训练,作者认为它难以迁移到代码领域,形成“safety generalization lag”,使语法合法代码中嵌入的恶意意图能绕过安全机制,构成 code-completion 盲区。
- 作者提出 CodeMimicry,一个全自动黑盒越狱框架:用具备编码能力的攻击模型把恶意查询封装进面向对象代码,借 docstring、注释和工具函数伪装,再套上无害的代码补全触发提示,并按历史反馈迭代优化。
- 在 8 个商用 LLM 上,AdvBench 平均 ASR 96.25%、平均 1.51 次查询,HarmBench 为 96.07%、1.46 次,均优于模板式和优化式基线;首轮即达 75.5%,Python 等语言均保持高成功率。潜空间分析显示成功越狱样本的表示更接近良性代码、远离 refusal 方向,activation steering 结果与此一致。
- 方法依赖目标模型具备足够的代码生成与指令跟随能力,在编码能力弱的小模型上效果可能下降;且依赖注释和 docstring 这类字符串级侧信道,加入评论过滤后 ASR 明显降低。
据 论文全文(AI 生成) 整理,供快速了解,以论文原文为准。
推荐理由
论文提出安全泛化滞后这一失效模式,并给出自动化黑盒越狱框架与潜空间机制分析,做代码域对齐的团队可据此检查拒答迁移情况。