跳到正文
原文
arXiv:危险能力与安全评测· arXiv:2609.01210· Rui Yang·· 2026-09-01

C-SafeQA:面向中文响应级安全评测与安全裁判审计的基准

Who Judges the Judges? A Chinese Safety QA Benchmark for Evaluating LLM Responses and Safety Judges

AI 导读

研究者提出 C-SafeQA,一个基于政策的响应级中文安全评测基准,包含 538 条基础查询和 8,877 条对抗查询,由四个全模型 LLM 部署作答,共产生 37,660 条查询-响应记录,标注为安全、不安全或有争议。参考标签通过一致性感知的多模型裁决生成,并由三名安全专家对分层子集进行盲审。基准既支持目标模型安全评测,也支持用共享参考标签审计七个自动化安全裁判。基础查询的不安全响应率为 0.93% 至 3.35%,对抗查询为 11.68% 至 30.05%。

阅读原文arxiv.org