评测与基准arXiv 2606.18936
SciRisk-Bench:面向 AI4Science 安全的风险维度感知基准
提出 SciRisk-Bench,按风险维度与学科评测 AI4Science 安全
- arXiv
- 2606.18936
- 发表
- 层
- 模型层
- 场景
- 模型与 API
- 测试
- glm-5.1、kimi-k2.6、gemini-3-flash-preview 等 14 个
- 风险幻觉与编造
摘要SciRisk-Bench 以风险维度和学科诊断 AI4Science 安全。
SciRisk-Bench 是一个按风险维度和科学学科组织的 AI4Science 安全基准,用来看清失败来自哪一种风险机制、出现在哪个学科情境。作者认为 LLM 已介入科研问答、文献分析、实验规划和自主发现,而不安全输出不限于事实错误。现有科学能力基准不测安全,领域安全基准又多集中在化学、医学或生物,或只按宽泛安全类别打分。