评测与基准arXiv 2609.09798
CS-Guard:首个面向代码生成安全的 LLM 护栏评测基准
提出 CS-Guard 基准与虚构场景攻击,评测代码生成护栏
- arXiv
- 2609.09798
- 发表
- 层
- 应用层
- 场景
- 编程 Agent
- 测试
- CodeLlama-13B-Instruct、DeepSeekCoder-V2-Lite-16B、GPT-OSS-20B 等 7 个
摘要论文提出了代码安全护栏基准 CS-Guard,评估发现现有护栏对虚构场景攻击和代码级恶意请求防御较弱。
提出 CS-Guard 基准与虚构场景攻击,评测代码生成护栏
摘要论文提出了代码安全护栏基准 CS-Guard,评估发现现有护栏对虚构场景攻击和代码级恶意请求防御较弱。
提出能力洗钱攻击,让未对齐编排器拆分任务向对齐模型套取能力
摘要作者提出了能力洗钱攻击,发现未对齐编排器分解咨询对齐模型可恢复能力差距,指出需建立跨会话防御。
提出参考嫁接,在推理时用激活干预诱导出沙袋隐藏的能力
摘要提出参考嫁接在推理阶段以低成本匹配微调诱导效果,揭示隐瞒表征重叠与阈值门控机制。