评测与基准arXiv 2609.09798
CS-Guard:首个面向代码生成安全的 LLM 护栏评测基准
提出 CS-Guard 基准与虚构场景攻击,评测代码生成护栏
- arXiv
- 2609.09798
- 发表
- 层
- 应用层
- 场景
- 编程 Agent
- 攻击者
- 黑盒
- 测试
- CodeLlama-13B-Instruct、GPT-OSS-20B、Devstral-small-v2-24B 等 7 个
摘要论文提出了代码安全护栏基准 CS-Guard,评估发现现有护栏对虚构场景攻击和代码级恶意请求防御较弱。
提出 CS-Guard 基准与虚构场景攻击,评测代码生成护栏
摘要论文提出了代码安全护栏基准 CS-Guard,评估发现现有护栏对虚构场景攻击和代码级恶意请求防御较弱。
提出能力洗钱攻击,让未对齐编排器拆分任务向对齐模型套取能力
摘要作者提出了能力洗钱攻击,发现未对齐编排器分解咨询对齐模型可恢复能力差距,指出需建立跨会话防御。
提出 SafeMol,联合对齐分子多模态模型的文本与图输入
SafeMol 研究分子多模态模型在危险分子相关请求上的安全对齐,并同时看过拒和任务效用。