评测与基准arXiv 2607.18665
SciHazard:面向科研安全的危险能力评测基准与分解式危害评分
构建 SciHazard 基准,评测科研智能体与 LLM 的科学危险能力
- arXiv
- 2607.18665
- 发表
- 层
- 应用层
- 被测模型
- WebThinker + DeepSeek-R1、InternAgent、Gemini Deep Research 等 19 个
- 风险危险能力
摘要SciHazard 用分解评分测科学滥用风险,作者称智能体抬高了可执行危害。
SciHazard 是一个科学滥用风险基准,配一个把危害拆开再合成的自动分数。