CodeMimicry:利用代码域安全泛化滞后实现结构化代码补全越狱
研究者提出 CodeMimicry,一个全自动黑盒越狱框架,把恶意意图嵌入语法合法的面向对象代码,借代码补全任务诱导模型输出有害内容。在 8 个商用大语言模型上,该方法在 AdvBench 上达到 96.25% 攻击成功率、平均仅 1.51 次查询,在 HarmBench 上为 96.07% 与 1.46 次查询,明显优于模板类和优化类基线。作者将这一现象归因于安全泛化滞后,即主要在自然语言上训练的对齐难以迁移到代码域,形成代码补全盲区。潜空间分析显示,成功的越狱样本在表示上接近良性代码,并系统性地避开拒答方向;激活引导实验进一步支持这一解释。作者也指出,该方法依赖目标模型的代码生成能力,且对注释与 docstring 这类字符串侧信道有依赖,正则过滤注释后攻击成功率降至 20% 至 26%。
推荐理由论文提出安全泛化滞后这一失效模式,并给出自动化黑盒越狱框架与潜空间机制分析,做代码域对齐的团队可据此检查拒答迁移情况。