CS-Guard:首个面向代码生成安全的 LLM 护栏评测基准
CS-Guard: Benchmarking LLM Guardrails for Code Generation Security
AI 导读
CS-Guard 是首个系统评测代码生成安全护栏的基准,覆盖文本到代码与代码到代码两类场景。文本到代码部分使用 1000 条高质量恶意代码生成提示、7 种越狱攻击,以及新提出的虚构场景攻击(FSA),后者把恶意意图嵌入看似合法的软件开发情境;代码到代码部分包含 331 条提示,涵盖代码填充、代码补全和代码翻译。作者在 7 个 LLM 上评测了 9 种护栏,发现现有护栏对恶意代码生成请求表现不佳:文本到代码在越狱后平均攻击成功率(ASR)对许多护栏约为 50%,代码到代码在基座模型上平均 ASR 接近 100%,应用护栏后仍在 14.4% 到接近 100% 之间;FSA 对许多护栏的 ASR 接近 100%。多轮 FSA 在所选护栏上的 ASR 为 65.0% 到 92.3%。作者按三层分类法组织护栏,并以 CC BY-NC-SA 4.0 许可发布基准与数据。
论文速读
- LLM 被用于生成恶意软件,但代码生成安全场景下 guardrail 的实际效果尚不清楚。已有研究多把恶意软件当作宽泛风险分类中的小类,且偏重自然语言指令,缺少针对代码生成的细粒度评估。
- 作者提出 CS-Guard,首个系统评估代码生成安全 guardrail 的 benchmark。它包含 text-to-code(1000 条高质量恶意生成 prompt、7 种 jailbreak 攻击,以及新的 fictional scenario attack FSA)和 code-to-code(331 条覆盖 code infilling、completion、translation 的 prompt),并给出三层 guardrail 分类法以便注册评估。
- 在 7 个 LLM 上评估 9 种 guardrail:text-to-code 经 jailbreak 后许多 guardrail 平均 ASR 约 50%;code-to-code 在 base LLM 上平均 ASR 接近 100%,多数 guardrail 下仍为 14.4% 到近 100%;FSA 在许多 guardrail 上 ASR 接近 100%。多轮 FSA 的 ASR 在 65.0% 到 92.3% 之间。
- 仅覆盖英文数据,未做多语言评估;多轮 jailbreak 评估不全面,FSA-MT 仅 20 个样本作试点;未评估需要额外训练或神经元访问的白盒 guardrail;internal guardrail 评估基于量化模型,结果未必适用于全精度版本。
据 论文全文(AI 生成) 整理,供快速了解,以论文原文为准。
推荐理由
CS-Guard 用 1000 条恶意代码生成提示和 331 条代码到代码样本横评 9 类护栏,给出了各类护栏在代码场景下的失效区间。