评测与基准arXiv 2609.09798
CS-Guard:首个面向代码生成安全的 LLM 护栏评测基准
提出 CS-Guard 基准,评测代码生成护栏对虚构场景攻击的防御
- arXiv
- 2609.09798
- 发表
- 层
- 提示层
- 攻击者
- 黑盒
- 被测模型
- CodeLlama-13B-Instruct、DeepSeekCoder-V2-Lite-16B、GPT-OSS-20B 等 7 个
摘要论文提出了代码安全护栏基准 CS-Guard,评估发现现有护栏对虚构场景攻击和代码级恶意请求防御较弱。
提出 CS-Guard 基准,评测代码生成护栏对虚构场景攻击的防御
摘要论文提出了代码安全护栏基准 CS-Guard,评估发现现有护栏对虚构场景攻击和代码级恶意请求防御较弱。
构建 SciHazard 基准,评测科研智能体与 LLM 的科学危险能力
SciHazard 是一个科学滥用风险基准,配一个把危害拆开再合成的自动分数。
提出 JAWS-Bench,评测代码 Agent 在三级工作区中的越狱与恶意代码可执行性
摘要论文提出了评估代码智能体端到端恶意代码越狱的 JAWS-Bench,发现多文件与智能体推理会明显放大可部署危害。